
Paperis 아티클
한 번 센 숫자는 얼마나 흔들리나 — 괄호 안 두 숫자, 신뢰구간
다른 사람들을 모았다면 조금 다른 숫자가 나왔을 것입니다. 괄호 안 두 숫자는 그 흔들림의 폭이고, 괄호를 만나면 「가장 작게 잡으면 얼마?」와 「가장 크게 잡으면 얼마?」를 물으면 됩니다
한 번 센 숫자는 얼마나 흔들리나 — 괄호 안 두 숫자, 신뢰구간
제목 뒤에 붙은 괄호
「새 예방약, 심장병 위험 절반으로 낮춰」. 신문 제목에서 한 번쯤 보셨을 문장입니다. 이런 제목에는 「몇 명 중에서?」와 「얼마 동안?」을 물으면 절반이 몇 명인지 드러난다는 이야기를 상대위험과 절대위험을 다룬 글에서 했습니다.
그 두 물음의 답이 기사에 적혀 있다고 해 보겠습니다. 예방약을 먹지 않은 사람은 1년 동안 100명 중 2명이 병에 걸렸고, 먹은 사람은 100명 중 1명이 걸렸습니다. 1,000명으로 옮기면 20명과 10명이니, 1,000명당 10명이 덜 걸렸습니다.
논문 요약에서는 이 숫자 뒤에 괄호가 하나 더 붙습니다. 양쪽에 1만 명씩 모은 연구였다면 「1,000명당 10명 덜 걸렸다(95% 신뢰구간 7~13명)」 같은 식입니다. 이 괄호 안의 두 숫자, 7과 13이 이 글의 주인공입니다.
괄호 안 두 숫자는 한 번의 연구로 얻은 숫자가 얼마나 흔들릴 수 있는지를 보여 줍니다. 이 글은 그 흔들림이 어디서 오는지, 괄호가 넓고 좁은 것이 무슨 뜻인지, 그리고 괄호를 만났을 때 무엇을 물으면 되는지를 다룹니다.
이 글의 예방약과 숫자는 이해를 돕기 위해 만든 예시이고, 어느 연구의 결과도 아닙니다. 이 예시를 글 끝까지 들고 가겠습니다. 뒤에 나오는 실제 연구들은 괄호가 실제 논문에서 어떻게 나타나는지를 보여 주는 예입니다.
다른 사람을 모았다면 다른 숫자가 나왔다
먼저 100명을 모은 작은 예를 보겠습니다. 예방약을 먹지 않은 100명 가운데 1년 동안 2명이 병에 걸렸습니다. 이 2명은 바로 이 100명에게서 센 숫자입니다.
다른 100명을 모아 같은 1년을 지켜봤다면 어땠을까요. 세상의 모든 사람을 다 셀 수 있을 때 정말 100명 중 2명이 걸리는 병이라고 쳐도, 새로 모은 100명에서는 0명이 나올 수도 있고 4명이 나올 수도 있습니다. 이 글이 계산해 보면, 0명이 나올 확률은 열에 하나가 넘고 4명이 나올 확률도 열에 하나 가까이 됩니다. 누가 뽑혔느냐에 따라 숫자가 흔들립니다.

이 흔들림을 말하려면 두 가지 이름이 필요합니다. 표본은 연구가 실제로 모아서 잰 사람들입니다. 참값은 연구가 알고 싶은 대상 전체를 다 셀 수 있다면 나올 숫자입니다. 앞의 「100명 중 2명」은 표본에서 나온 숫자이고, 참값은 아무도 직접 보지 못합니다.
표본을 연구해서 얻는 것은 참값의 어림뿐입니다 (PMID 19114737). 심리학 연구에서 흔한 정도의 표본 크기로는, 연구를 완벽하게 똑같이 되풀이해도 효과의 크기가 표본마다 상당히 달라질 수 있습니다 (PMID 32378428). 작은 연구에서 흐릿하게 보이던 「경향」은 표본을 키우면 사라지거나 방향이 바뀔 수도 있다는 지적이 있습니다 (PMID 15526517).
연구 한 편이 내놓는 숫자는 표본 하나에서 나온 숫자이고, 다른 표본이었다면 조금 다른 숫자가 나왔을 것입니다. 그래서 숫자 하나만 받아서는 그 숫자가 참값에서 얼마나 떨어져 있을 수 있는지 알 수 없습니다.
괄호는 흔들림의 폭이다
처음의 괄호로 돌아가겠습니다. 이번에는 예방약을 먹은 사람과 먹지 않은 사람을 1만 명씩 모아 1년 동안 지켜본 연구라고 하겠습니다. 먹지 않은 쪽에서 200명, 먹은 쪽에서 100명이 병에 걸렸습니다. 1,000명당으로 옮기면 20명과 10명이고, 차이는 1,000명당 10명입니다.
이 10명 뒤에 붙은 「95% 신뢰구간 7~13명」이 괄호입니다. 신뢰구간은 연구가 내놓은 값 하나 옆에, 이 자료와 어긋나지 않는 값들의 범위를 함께 적어 둔 것입니다. 괄호는 이 자료와 어울리는 값들을 적고, 그 폭은 결과가 얼마나 정밀한지를 말해 줍니다 (PMID 38219106). 이 예시에서는 1,000명당 7명 덜 걸리게 하는 약이라고 해도, 13명 덜 걸리게 하는 약이라고 해도 이 자료와 어긋나지 않습니다.
가운데의 10명은 이 표본에서 실제로 나온 숫자입니다. 양 끝의 7명과 13명은 표본이 흔들렸을 수 있는 만큼을 감안해 넓힌 자리입니다. 그래서 괄호는 두 가지를 함께 말합니다. 괄호가 놓인 자리는 효과가 어느 쪽으로 얼마쯤인지를, 괄호의 폭은 그것을 얼마나 확실하게 아는지를 말합니다 (PMID 9172963).
정밀도는 숫자가 얼마나 덜 흔들리는지를 가리키는 말로, 구간이 좁으면 정밀한 것이고 넓으면 정밀하지 않은 것입니다. 괄호가 좁을수록 어림이 정밀합니다 (PMID 9172963).
같은 가운데 숫자라도 괄호는 다를 수 있습니다. 같은 비율로 병에 걸렸지만 모은 사람 수가 다를 뿐인 연구 셋을 나란히 놓아 보겠습니다. 셋 다 이 글이 만든 예시이고, 괄호는 이 글이 흔히 쓰는 계산법으로 어림한 값입니다. 계산법에 따라 끝자리가 1명쯤 달라질 수 있습니다. 100명씩 줄은 계산법에 따라 수십 명씩 달라져서 숫자를 적지 않았습니다.
| 한쪽에 모은 사람 | 병에 걸린 사람 (먹지 않음 → 먹음) | 가운데 숫자 (1,000명당) | 괄호 (1,000명당) |
|---|---|---|---|
| 100명 | 2명 → 1명 | 10명 덜 | 수십 명 더 ~ 수십 명 덜 |
| 1,000명 | 20명 → 10명 | 10명 덜 | 1명 더 ~ 21명 덜 |
| 1만 명 | 200명 → 100명 | 10명 덜 | 7명 덜 ~ 13명 덜 |
가운데 숫자는 세 줄 모두 1,000명당 10명입니다. 달라진 것은 괄호의 폭이고, 세 줄이 다른 곳은 모은 사람의 수 하나입니다. 100명씩 모은 연구의 괄호는 약이 병을 수십 명 더 일으키는 쪽부터 수십 명 막는 쪽까지 걸칠 만큼 넓습니다.

가운데 숫자가 같아도 괄호가 넓으면 덜 확실하고, 좁으면 더 확실합니다.
사람이 많을수록 괄호는 좁아진다
앞의 표에서 한쪽에 모은 사람을 1,000명에서 1만 명으로 10배 늘렸더니, 괄호의 폭은 22명에서 6명으로 줄었습니다. 사람은 10배가 됐는데, 폭은 3분의 1 아래로 줄었습니다. 좁은 괄호를 얻으려면 그만큼 많은 사람을 모아야 합니다.
괄호의 폭에 영향을 주는 요인은 여럿이고, 신뢰구간 입문 글들은 이를 따로 정리해 둡니다 (PMID 25742216). 그 가운데 연구자가 가장 직접 정할 수 있는 것이 모을 사람의 수입니다. 괄호가 원하는 만큼 좁아지도록 몇 명을 모을지 미리 계산하는 방법도 나와 있습니다 (PMID 12971200).
그런데 연구자들이 흔히 인원을 정하는 기준은 따로 있습니다. 효과가 있을 때 그것을 잡아낼 확률입니다. 이 기준과 기대하는 효과의 크기에 맞춰 정한 인원은, 참값을 정밀하게 어림할 만큼 좁은 괄호를 주기에는 너무 적은 경우가 많습니다 (PMID 21336224).
실제 조사에서도 셀 사람이 많은 지표의 괄호가 좁은 편이었습니다. 다만 사람 수만의 차이는 아니었습니다. 난민 거주지에서 한 인구 조사 203건을 모아, 어린아이가 무엇을 먹는지 재는 지표들의 괄호를 살핀 연구가 있습니다 (PMID 40803324). 모유를 먹은 적이 있는지를 재는 지표는 조사한 두 살 미만 아이를 모두 셉니다. 이 지표의 괄호는 가운데 숫자에서 위아래로 3.1%포인트쯤 벌어졌습니다(203건을 줄 세웠을 때 한가운데 값). 저자들은 표본이 비교적 컸고 비율이 100%에 가까웠던 것을 그 이유로 적습니다.
생후 6개월 미만 아이에게 모유만 먹였는지를 재는 지표는, 두 살 미만 아이 가운데 일부만 셉니다. 이 지표의 괄호는 위아래로 12.6%포인트쯤 벌어져, 가장 넓은 편에 들었습니다. 저자들은 정밀도가 낮으니 이런 지표의 과거 조사 결과를 읽을 때 크게 조심해야 한다고 결론짓습니다.
적은 사람으로 한 연구가 흔한 분야도 있습니다. 2018~2021년에 나온 우울증 선별 검사의 정확도 연구를 살핀 조사에서, 괄호를 적었거나 계산할 수 있었던 103편 가운데 58편은 검사가 우울증을 잡아내는 비율에 붙은 괄호의 폭이 21%포인트 이상이었습니다 (PMID 35362161). 잡아내는 비율을 가장 작게 잡을 때와 가장 크게 잡을 때가 그만큼 벌어진다는 뜻입니다.
저자들은 대부분의 연구가 정밀한 어림을 내기에는 사람이 너무 적었다고 결론짓고, 이전 조사와 결과가 비슷했다고 적습니다. 괄호의 폭은 대개 모은 사람의 수가 정하고, 사람이 적으면 괄호는 넓어집니다.
괄호가 「차이 없음」을 넘는가
1,000명씩 모은 예시의 괄호를 다시 보겠습니다. 1,000명당 1명 더 걸리는 쪽부터 21명 덜 걸리는 쪽까지입니다. 이 괄호 안에는 「차이 없음」, 곧 0명이 들어 있습니다. 약이 조금 해로운 쪽부터 꽤 이로운 쪽까지가 모두 이 자료와 어긋나지 않는다는 뜻입니다.
괄호가 「차이 없음」을 품는지는 「통계적으로 유의했는가」와 같은 질문입니다. 이 괄호는 0을 품으니, 유의하지 않은 쪽입니다. p값은 차이가 전혀 없다고 쳤을 때 지금만큼 또는 그보다 더 벌어진 결과가 나올 확률입니다. p값을 다룬 글에서 본 그 숫자입니다. 흔히 쓰는 계산에서는 둘이 이렇게 맞물립니다. 95% 괄호가 「차이 없음」을 품으면, p값은 0.05보다 큽니다. 「차이 없음」을 비켜 가면, p값은 0.05보다 작습니다. 괄호만 보고도 통계적으로 유의한지를 따질 수 있습니다 (PMID 25742216).
괄호는 여기서 한 걸음 더 갑니다. 유의성 검정은 효과가 없다는 가정이 버틸 만한지만 묻고, 효과의 크기를 어림하지는 않습니다. 유의성 검정 대신 효과의 크기를 괄호와 함께 적으라는 권고가 오래전부터 있었습니다. 그렇게 적으면 검정이 주던 정보가 모두 담기면서 크기가 앞에 드러난다는 것입니다 (PMID 9012613).
1,000명씩 연구로 옮기면 이렇습니다. 가장 작게 잡으면 약은 1,000명당 1명을 더 걸리게 하고, 가장 크게 잡으면 21명을 덜 걸리게 합니다. 이 결과를 「효과가 없었다」로 읽으면 21명 쪽 끝이 사라집니다. 「이 자료로는 아직 좁히지 못했다」가 더 가까운 읽기입니다. 괄호가 의미 있을 만큼 이로운 값과 의미 있을 만큼 해로운 값에 모두 걸칠 때는 결과를 「불분명」으로 읽고, 그렇지 않으면 관측된 쪽으로 읽자는 제안도 있습니다 (PMID 19114737). 이 제안에서는 무엇을 의미 있는 크기로 칠지를 먼저 정해야 합니다.
1만 명씩 연구의 괄호 7~13명은 0명을 품지 않습니다. 가장 작게 잡아도 1,000명당 7명이 덜 걸립니다. 폭이 좁고 양 끝이 모두 한쪽에 있으니, 방향도 크기도 꽤 분명합니다.
괄호가 「차이 없음」을 비켜 갔다면, 가장 작게 잡은 끝이 사람들에게 의미가 있을 만큼 큰지를 이어서 묻습니다. 괄호 안의 값들은 그 결과가 실제로 중요할 여지가 있는지를 말해 줍니다 (PMID 38219106).
나눗셈으로 적은 괄호는 읽는 자리가 하나 다릅니다. 「위험이 0.5배」처럼 상대위험으로 적은 숫자에서는 「차이 없음」이 1배, 곧 1입니다. 그런 괄호에서는 1을 품는지를 보면 됩니다.
p값과 괄호는 보통 함께 쓰입니다. 제대로 해석하면 p값도 쓸모 있는 정보를 주지만 유일한 판단 기준으로 쓰지는 말고, 효과의 크기와 괄호와 맥락을 투명하게 적으라는 것이 한 종설의 결론입니다 (PMID 41250654). 1997년의 한 정리 글은 괄호로 적는 방식에도 한계가 있고 잘못 읽힐 위험이 사라지지 않는다고 적었습니다. 어느 방식이 나은지 합의가 아직 없어서, 둘을 함께 적자는 전문가들도 있다고 덧붙였습니다 (PMID 9172963).
괄호가 「차이 없음」을 품는지는 대개 p값과 같은 이야기를 하고, 괄호의 양 끝은 효과를 가장 작게, 가장 크게 잡으면 얼마인지를 더 말해 줍니다.
95%는 무엇에 붙은 숫자인가
괄호 앞의 95%에도 이름이 있습니다. 먼저 이 95%가 어떻게 만들어지는지부터 보겠습니다.
1만 명씩 연구를 100개의 연구팀이 저마다 새 표본으로 되풀이한다고 상상해 보겠습니다. 표본이 흔들리니, 팀마다 가운데 숫자도 괄호도 조금씩 다르게 나옵니다. 그 100개의 괄호 가운데 참값을 품은 괄호가 평균 95개쯤 되도록 만드는 계산법이 95% 신뢰구간입니다.
신뢰수준은 괄호 앞에 붙는 95%로, 같은 방식으로 연구를 끝없이 되풀이하면 그렇게 만든 괄호들 가운데 95%가 참값을 품는다는 뜻입니다. 여론조사 기사 끝에 붙는 「95% 신뢰수준」도 이 95%입니다.

흔한 오해는 이 95%를 눈앞의 괄호 하나에 붙이는 것입니다. 「참값이 95% 확률로 7명과 13명 사이에 있다」고 읽는 식입니다. 이 계산법의 생각에서는 참값이 움직이지 않는 하나의 숫자이고, 표본마다 움직이는 것은 괄호 쪽입니다. 눈앞의 괄호 하나는 이미 그려졌고, 참값을 품었거나 품지 못했거나 둘 중 하나입니다. 어느 쪽인지는 알 수 없습니다.
95%는 괄호를 만드는 방법이 얼마나 자주 참값을 품는지에 붙은 숫자이고, 눈앞의 괄호 하나가 참값을 품었는지는 알려 주지 않습니다. 괄호 하나를 두고 할 수 있는 말은 이 정도입니다. 이 괄호는 대개 참값을 품는 방법으로 만든 것이고, 그 안의 값들은 이 자료와 어긋나지 않습니다.
신뢰구간을 읽는 일은 전문가에게도 쉽지 않은 것으로 보고됐습니다. 심리학 연구자 120명과 학생 442명에게 신뢰구간을 해석한 문장 여섯 개가 참인지 거짓인지를 물은 조사가 있습니다 (PMID 24420726). 연구진의 분류로는 여섯 문장이 모두 틀린 해석이었는데, 연구자와 학생 모두 평균 세 개가 넘는 문장을 옳다고 골랐습니다. 통계적 추론을 배운 적 없는 학생들보다 연구자들이 거의 낫지 않았습니다.
이 결과에는 반론이 붙었습니다. 한 비판 논문의 첫째 논거는 문장의 분류였습니다. 신뢰구간에는 두 가지 해석이 있어서, 어떤 문장에 동의했다는 것만으로 오해했다고 단정할 수 없다는 것입니다. 둘째 논거는 모든 문장에 답하게 한 설계가 이 결과를 만들었을 수 있다는 것이었습니다.
이 비판 논문의 저자들은 옳은 해석을 담은 문장 두 개를 더해 다시 조사했습니다. 아직 배우지 않은 1학년생은 옳은 문장과 틀린 문장을 똑같은 비율로 골랐습니다. 두 종류 문장이 겉보기로는 똑같이 그럴듯했다는 뜻이라고 저자들은 봅니다. 그런데 석사과정 학생들은 모르고 한 응답을 걷어 내자 옳은 문장을 뚜렷이 더 많이 골랐습니다. 다만 모르겠다고 인정한 경우가 예상보다 많았습니다 (PMID 27458424).
원래 조사의 저자들은 다른 비판자들에게 다시 답하며 주장을 지켰습니다. 비판자들이 내놓은 다른 해석은 그 자체로는 옳아도 설문 문장을 받아들일 만하게 읽은 것이 못 되고, 참값이 어디 있는지에 대해서는 아무것도 말하지 않는다는 것입니다 (PMID 26620955).
전문가가 이 구분을 얼마나 오해하는지는 이렇게 아직 다툼 중입니다.
기사 한 줄에 괄호를 대 보면
「새 예방약, 심장병 위험 절반으로」라는 기사 두 개를 만났다고 해 보겠습니다. 둘 다 1년 동안 1,000명당 20명이 걸리던 병이 10명으로 줄었다고 적습니다. 「몇 명 중에서?」와 「얼마 동안?」의 답이 모두 있습니다. 기사 끝에는 괄호도 옮겨져 있습니다. 기사 A는 「1,000명당 10명 덜(95% 신뢰구간 7~13명)」, 기사 B는 「1,000명당 10명 덜(95% 신뢰구간 1명 더 ~ 21명 덜)」입니다.
첫째 물음은 「가장 작게 잡으면 얼마?」입니다. A는 가장 작게 잡아도 1,000명당 7명이 덜 걸립니다. B는 가장 작게 잡으면 1,000명당 1명이 더 걸립니다. 해로운 쪽까지 괄호에 들어 있습니다.
둘째 물음은 「가장 크게 잡으면 얼마?」입니다. A는 13명, B는 21명입니다. 넓은 괄호는 작은 쪽으로도 큰 쪽으로도 더 멀리 뻗습니다. 그래서 B를 「효과 없음」으로 읽으면 큰 효과였을 가능성까지 함께 지웁니다.
이 두 끝을 보면 괄호가 「차이 없음」을 품는지도 함께 보입니다. A는 품지 않고 B는 품습니다. p값으로 말하면 A는 「통계적으로 유의했다」이고 B는 그렇지 않습니다. 기사가 「통계적으로 유의했다」만 적었다면 괄호가 「차이 없음」을 비켜 갔다는 것까지는 알 수 있어도, 가장 작게 잡을 때 7명인지 그보다 훨씬 적은지는 알 수 없습니다.
B의 괄호가 왜 넓은지 궁금하면 몇 명을 모았는지를 찾습니다. 이 예시에서는 A가 1만 명씩, B가 1,000명씩입니다. 기사에 괄호가 아예 없다면, 그 숫자가 얼마나 흔들릴 수 있는지는 알 수 없습니다.
한 가지는 괄호로도 알 수 없습니다. 괄호는 우연히 누가 뽑혔느냐에서 오는 흔들림을 적을 뿐, 연구가 치우쳤는지는 말하지 않습니다. 병원 기록 같은 관찰 자료로 약의 효과를 어림하는 연구를 다룬 한 논문은, 보통 숫자로 적는 것은 이 우연한 흔들림뿐이라고 적습니다. 이 흔들림은 자료가 커질수록 0에 가까워지지만, 치우침에서 오는 오차는 사람을 아무리 많이 모아도 줄지 않는다는 것입니다 (PMID 29531023).
95%라는 약속도 연구가 치우치지 않았을 때의 약속입니다. 같은 논문은 이 치우침을 감안해 괄호를 고쳐 잡은 뒤에야 95% 괄호가 참값을 95% 품는다는 원래의 성질이 되살아났다고 보고합니다 (PMID 29531023).
엉성하게 수행된 시험은 치우침 때문에 효과가 크게, p값이 작게 나오기 쉽다는 지적도 있습니다 (PMID 38219106). 무엇이 숫자를 치우치게 하는지는 교란을 다루는 글의 몫입니다.
괄호를 만나면 「가장 작게 잡으면 얼마?」와 「가장 크게 잡으면 얼마?」를 물으면, 그 숫자가 얼마나 흔들릴 수 있는지가 드러납니다.
어디를 더 볼까
이 글은 괄호 하나를 읽는 데서 멈췄습니다. 두 무리의 괄호가 서로 겹쳐도 차이가 없다고 단정할 수는 없다는 점(PMID 30119088), 새 치료가 기존 치료보다 「많이 나쁘지는 않다」를 보이는 시험에서 괄호의 어느 끝을 봐야 하는지, 그림에 그려진 막대가 괄호인지 아닌지는 「신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법」이 이어서 다룹니다. 전문가의 오해를 두고 벌어진 다툼도 그 글이 더 자세히 싣습니다.
p값이 정확히 무엇의 확률인지는 「p=0.03은 무엇의 확률인가 — p값이 답하는 하나의 질문」이, 유의성이 몇 명의 결과에 달려 있는지는 「0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법」이 봅니다. 여러 연구의 괄호를 한 그림에 모아 읽는 법은 「메타분석은 평균을 내지 않는다 — 숲그림의 마름모가 만들어지는 법」이 다룹니다.
「숫자 첫걸음」의 다른 글들은 「위험 50% 감소」가 몇 명인지 묻는 상대위험과 절대위험, 「통계적으로 유의했다」가 무엇을 말하는지 묻는 p값, 그리고 같이 움직인다고 원인은 아니라는 교란을 다룹니다.
근거 논문
- "Making meaningful inferences about magnitudes." (2006) — PMID 19114737 — 표본 연구는 참값(모집단 값)의 어림만 준다. 신뢰한계로 참값의 그럴듯한 범위를 잡고, 그 범위가 실질적으로 이로운 값과 실질적으로 해로운 값에 모두 걸치면 결과를 불분명으로, 그렇지 않으면 관측된 크기 쪽으로 판단하자고 제안한다(제안 논문).
- "Knowing how effective an intervention, treatment, or manipulation is and increasing replication rates: accuracy in parameter estimation as a partial solution to the replication crisis." (2021) — PMID 32378428 — 심리학에서 흔한 표본 크기로는 효과크기의 표본분포가 매우 넓어, 완벽한 재현에서도 추정값이 표본마다 상당히 달라질 수 있다. 훨씬 큰 연구가 필요하다고 결론짓는다.
- "Trend in randomized controlled trials." (2003) — PMID 15526517 — 유의하지 않은 「경향」은 표본을 늘리면 사라지거나 방향이 바뀔 수도 있다. 경향을 논하려면 신뢰구간을 해석해야 한다.
- "Editorial Commentary: The Statistical Fragility Index of Medical Trials Is Low By Design: Critical Evaluation of Confidence Intervals Is Required." (2024) — PMID 38219106 — 신뢰구간은 자료와 양립하는 값의 범위이고, 폭은 결과의 정밀도를, 안의 값들은 임상적으로 중요할 여지를 말한다. 엉성하게 수행된 시험은 치우침 때문에 큰 효과·작은 p값이 나오기 쉽다(편집 논평).
- "[Statistical results: which method of presentation to chose?]." (1997) — PMID 9172963 — 추정과 신뢰구간으로 연관의 방향과 크기를 알 수 있고, 구간이 좁을수록 추정이 정밀하다. 이 방법에도 한계가 있고 오독 위험이 사라지지 않으며, 합의가 없어 두 방법을 함께 제시하자는 전문가도 있다.
- "A primer on confidence intervals in psychopharmacology." (2015) — PMID 25742216 — 신뢰구간의 비수학적 입문. 좁은·넓은 구간의 해석, 폭에 영향을 주는 요인, 구간으로 통계적 유의성을 따지는 법을 다루고, 결론을 끌어낼 때 신뢰구간이 p값보다 훨씬 많은 정보를 준다고 맺는다.
- "Obtaining power or obtaining precision. Delineating methods of sample-size planning." (2003) — PMID 12971200 — 신뢰구간의 기대 폭이 충분히 좁도록 표본 크기를 정하는 방법(모수 추정의 정확도 관점)을 검정력 관점과 나란히 제시한다.
- "Setting sample size to ensure narrow confidence intervals for precise estimation of population values." (2011) — PMID 21336224 — 원하는 검정력과 기대 효과크기로 정한 표본 크기는 모집단 값을 정밀하게 추정할 만큼 좁은 구간을 주기에 흔히 너무 작다.
- "Precision and Sample Sizes Achieved for Infant and Young Child Feeding Indicators Evaluated in Anthropometry Assessments: A Secondary Analysis of Population-Representative Surveys in Refugee Settings." (2026) — PMID 40803324 — 2013~2019년 15개국 난민 거주지 조사 203건. 모유 수유 경험 지표는 0~23개월 아이 모두를 포함해 표본이 크고 비율이 100%에 가까워 가장 정밀(반폭 중앙값 3.1%), 6개월 미만 완전 모유 수유 지표는 12.6%로 정밀도가 낮았다. 이런 지표의 과거 조사 해석에 큰 주의가 필요하다고 결론짓는다.
- "Sample size and precision of estimates in studies of depression screening tool accuracy: A meta-research review of studies published in 2018-2021." (2022) — PMID 35362161 — 2018~2021년 우울증 선별 도구 정확도 연구: 구간이 있거나 계산 가능한 103편 중 58편(56%)의 민감도 구간 폭이 21% 이상. 대부분 정밀한 추정을 내기에 표본이 너무 작았고, 이전 조사와 결과가 비슷했다.
- "Hypothesis testing and effect size estimation in clinical trials." (1997) — PMID 9012613 — 유의성 검정은 효과가 없다는 가설의 존립만 다루고 효과의 크기를 추정하지 않는다. 신뢰구간을 붙인 효과크기 추정은 검정의 정보를 모두 담으면서 임상적 중요성을 앞세운다고 권고한다.
- "The P Value: What It Is and What It Is Not." (2025) — PMID 41250654 — p값은 제대로 해석하면 쓸모 있는 정보를 주지만 유일한 추론 기준으로 쓰면 안 되고, 효과크기·신뢰구간·맥락의 투명한 보고가 더 믿을 만한 토대라고 결론짓는다(종설).
- "Robust misinterpretation of confidence intervals." (2014) — PMID 24420726 — 심리학 연구자 120명·학생 442명에게 연구진이 모두 거짓으로 분류한 신뢰구간 해석 진술 6개를 물었더니, 두 집단 모두 평균 3개 넘게 지지했다. 연구자가 통계적 추론 교육을 받지 않은 학생을 거의 앞서지 못했다.
- "The Interpretation of Scholars' Interpretations of Confidence Intervals: Criticism, Replication, and Extension of Hoekstra et al. (2014)." (2016) — PMID 27458424 — 신뢰구간에는 두 해석이 있어 일부 문항 동의만으로 오해를 추론할 수 없고, 강제 응답 설계가 결과를 인위적으로 만들었을 수 있다. 옳은 문항 2개를 더한 재현에서 1학년생은 옳은 문항과 틀린 문항을 같은 비율로, 석사생은 모르고 한 응답을 걷어 내자 옳은 문항을 더 지지했다(모른다는 인정도 예상보다 많았다).
- "Continued misinterpretation of confidence intervals: response to Miller and Ulrich." (2016) — PMID 26620955 — 원조사 저자들의 답변: 비판자들의 대안 해석은 옳더라도 설문 문항의 수용 가능한 독법이 못 되고, 자료에 근거가 없으며, 정의의 재진술이라 모수의 위치를 함의하지 않는다.
- "Empirical confidence interval calibration for population-level effect estimation studies in observational healthcare data." (2018) — PMID 29531023 — 관찰 의료자료의 오차는 표본 변동에서 오는 무작위 오차와 교란·선택 치우침·측정 오차에서 오는 계통 오차로 나뉜다. 보통 무작위 오차만 정량화되는데, 이는 자료가 커지면 0에 수렴하고 계통 오차는 표본 크기와 무관하게 남는다. 음성·양성 대조로 구간을 보정하면 95% 구간이 참 효과를 95% 덮는 명목 성질이 회복된다고 보고한다.
- "A Tale of Confusion From Overlapping Confidence Intervals." (2019) — PMID 30119088 — 두 독립 집단 평균의 신뢰구간이 겹쳐도 참된 유의한 차이가 부정되는 것은 아니다. 차이 자체의 구간을 추정하고, 겹침을 차이 없음으로 가정하지 말라고 권한다.