Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법

「한 번 센 숫자는 얼마나 흔들리나 — 괄호 안 두 숫자, 신뢰구간」의 후속편입니다. 넓은 괄호가 얼마나 넓어야 문제인지, 그림의 막대가 괄호인지, 두 무리의 괄호가 겹쳐도 차이가 있을 수 있는 이유, 「많이 나쁘지는 않다」를 보이는 시험에서 괄호의 어느 끝을 보는지를 이어서 봅니다.

🧱기초✦AI 생성기초과학 · 2026년 10월 5일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법

잔류태반은 아기를 낳은 뒤에도 태반이 자궁 안에 남아 있는 상태이고, 이때는 손으로 태반을 떼어 냅니다. 이 시술에 어떤 마취가 좋은지를 두고 임상시험을 모아 본 리뷰에서, 조건에 맞는 시험은 한 편, 여성 30명뿐이었습니다. 시술자가 통증 조절이 잘됐다고 본 비율은 한쪽 방법이 다른 쪽의 1.50배였습니다. 그 뒤에 괄호가 붙어 있고, 괄호 안의 두 숫자는 0.71과 3.16입니다. 여성 본인이 통증 조절에 만족한 비율은 반대쪽으로 기울어 0.82배였고, 괄호는 0.49~1.37이었습니다. 두 괄호 모두 「늘었다」 쪽과 「줄었다」 쪽에 함께 걸쳐 있어서, 리뷰는 두 가지 만족 모두 어느 쪽인지 확실하지 않다고 적습니다.

리뷰 저자들은 작은 시험 한 편으로는 이 마취들의 효과와 안전성을 평가할 근거가 불충분하다고 결론지었고, 근거의 질을 「매우 낮음」으로 매겼습니다. 등급을 내린 사유는 둘입니다. 하나는 설계의 한계이고, 다른 하나는 정밀하지 않다는 것입니다. 정밀하지 않다는 말은 작은 시험 한 편뿐이고, 사건이 적거나 없었으며, 괄호가 넓다는 뜻입니다. 잘 설계된 다기관 무작위 시험이 필요하다는 것이 마지막 결론입니다 (PMID 32529658).

이런 괄호 하나를 읽는 기본은 시리즈의 첫걸음 편에서 다뤘고, 바로 다음 절에서 짧게 되짚습니다. 이 글은 거기서 네 가지 물음으로 한 걸음 더 갑니다. 괄호가 얼마나 넓어야 문제인지, 그림에 그은 막대가 괄호인지, 두 무리의 괄호가 겹칠 때 무엇을 말할 수 있는지, 「많이 나쁘지는 않다」를 보이려는 시험에서 괄호의 어느 끝을 보는지입니다. 마지막으로, 전문가도 괄호를 잘못 읽는지를 두고 벌어진 다툼을 자세히 싣습니다.

⚠️ 아래 나오는 병과 치료의 이름은 전부 숫자를 읽는 법을 보이기 위한 사례입니다. 어떤 치료가 좋고 나쁜지에 대한 판단이 아니고, 각 숫자는 그 연구의 설계와 대상 안에서만 뜻을 가집니다.

다시 짚는 기본 — 첫걸음이 세워 둔 것

신뢰구간은 연구가 내놓은 값 하나 옆에, 이 자료와 어긋나지 않는 값들의 범위를 함께 적어 둔 것입니다. 앞에서 본 잔류태반 결과의 괄호가 바로 신뢰구간입니다. 괄호가 놓인 자리는 효과가 어느 쪽으로 얼마쯤인지를 말하고, 괄호의 폭은 그것을 얼마나 확실하게 아는지를 말합니다. 폭이 좁을수록 정밀하다고 하고, 폭은 대개 모은 사람의 수가 정합니다.

연구가 알고 싶은 대상 전체를 다 셀 수 있다면 나올 숫자를 참값이라고 부릅니다. 신뢰수준은 괄호 앞에 붙는 95%로, 같은 방식으로 연구를 끝없이 되풀이하면 그렇게 만든 괄호들 가운데 95%가 참값을 품는다는 뜻입니다. 다만 눈앞의 괄호 하나가 참값을 품었는지는 이 95%가 알려 주지 않습니다.

「차이 없음」은 두 값을 빼서 견주면 0이고, 나눠서 견주면 1입니다. 괄호가 이 「차이 없음」을 품는지는, 대개 p값이 0.05보다 큰지와 같은 이야기입니다. p값은 차이가 전혀 없다고 쳤을 때 지금만큼 또는 그보다 더 벌어진 결과가 나올 확률입니다. 그리고 괄호는 우연히 누가 뽑혔느냐에서 오는 흔들림만 적습니다. 연구 자체가 한쪽으로 치우쳤는지는 괄호가 말해 주지 않습니다. 여기까지가 「한 번 센 숫자는 얼마나 흔들리나 — 괄호 안 두 숫자, 신뢰구간」이 세워 둔 기본입니다.

괄호가 얼마나 넓어야 문제인가 — 판단이 바뀌는 문턱

잔류태반 시험의 95% 신뢰구간 0.71~3.16은 「차이 없음」인 1을 사이에 두고 양쪽으로 걸쳐 있습니다. 한쪽 끝은 시술자 만족이 30% 가까이 줄어드는 쪽이고, 다른 쪽 끝은 세 배 넘게 느는 쪽입니다. 리뷰가 이 근거를 정밀하지 않다고 본 사유 가운데 하나가 이 넓은 괄호였습니다. 괄호가 어느 정도로 넓어야 「정밀하지 않다」고 판정하는지에 대해, GRADE는 결정 문턱이라는 도구로 답합니다.

GRADE는 근거의 확실성을 등급으로 매기는 국제 방식입니다. 결정 문턱은 결과를 어떻게 판단할지가 바뀌는 지점입니다. 「효과가 없거나 사소하다」에서 「작게 이롭다」로 넘어가는 자리가 그 예입니다.

GRADE에서 정밀도를 판정할 때는 신뢰구간이 가리키는 그럴듯한 효과 크기들이 결정 문턱을 몇 개 넘는지를 봅니다. 그 수가 불확실성을 얼마나 크게 볼지와 확실성 등급을 몇 단계 내릴지를 정하는 데 쓰입니다. 이 설명은 GRADE 작업반의 최근 개념에서 착안한 한 논평에서 왔습니다. 논평은 이런 문턱이 진료지침 위원회 같은 자리에서 흔히 의식되지 않은 채 적용되고, 위원마다 다를 가능성이 크다고 봅니다. 아주 작은 효과도 통계적으로 유의할 수 있지만 환자나 대중에게는 중요하지 않을 수 있다는 점도 짚습니다. 논평의 주장은 문턱을 쓰는 데 여러 이점이 있고, 드러내 놓고 쓰면 판단이 더 투명하고 일관돼진다는 것입니다. 논평은 결정 문턱이 결과의 해석, 확실성 평가, 연구의 계획과 설계에서 여러 역할을 한다고 맺습니다 (PMID 41314355).

적어도 GRADE에서는, 괄호가 넓어서 문제가 되는 정도를 따질 때 그 안에 판단이 바뀌는 문턱이 몇 개 들어가는지가 쓰입니다.

그림의 막대는 괄호인가

논문 그림에는 두 무리의 평균을 막대나 점으로 찍고, 그 위아래로 가는 선을 그어 둔 것이 흔합니다. 이 선을 오차막대라고 부릅니다. 같은 모양의 오차막대가 실제로는 서로 다른 세 가지 가운데 하나를 그립니다.

첫째는 표준편차입니다. 표준편차는 사람들 한 명 한 명의 값이 평균에서 얼마나 흩어져 있는지를 나타내는 값입니다. 100명의 키를 재면 큰 사람도 작은 사람도 있는데, 그 흩어진 정도를 잽니다. 사람을 더 모아도 사람들이 원래 흩어진 정도는 그대로라서 표준편차는 줄지 않습니다.

둘째는 표준오차입니다. 표준오차는 같은 조사를 새 표본으로 되풀이할 때 평균값 자체가 얼마나 흔들리는지를 나타내는 값입니다. 평균 하나가 흔들리는 정도를 재기 때문에, 사람을 많이 모을수록 작아집니다.

셋째가 신뢰구간입니다. 신뢰구간 막대는 표준오차를 정해 둔 신뢰수준, 곧 괄호 앞에 붙는 그 퍼센트에 맞게 늘려 그린 폭입니다. 흔히 쓰는 95% 신뢰구간은 평균에서 양쪽으로 표준오차의 두 배쯤 벌어집니다. 표본이 작으면 이보다 더 벌어지고, 열 명 안팎이면 눈에 띄게 넓어집니다.

같은 자료라도 세 가지 가운데 무엇으로 그리느냐에 따라 선의 길이가 크게 다릅니다. 이 글이 만든 예로, 100명의 키 평균이 170cm이고 표준편차가 10cm라고 하겠습니다. 표준편차 막대는 160~180cm에 걸칩니다. 표준오차는 표준편차 10을 100의 제곱근인 10으로 나눈 1cm이고, 표준오차 막대는 169~171cm입니다. 95% 신뢰구간은 대략 168~172cm입니다. 결국 표준편차 막대는 신뢰구간보다 다섯 배, 표준오차 막대보다 열 배 깁니다.

평균 170cm에 그린 막대 세 개. 표준편차 막대는 160~180cm, 표준오차 막대는 169~171cm, 95% 신뢰구간 막대는 168~172cm로 표준편차 막대가 신뢰구간보다 다섯 배, 표준오차 막대보다 열 배 길다. 100명, 표준편차 10cm로 이 글이 만든 예다.

신뢰구간을 수식 없이 풀어 쓴 입문 논문도 신뢰구간을 표준편차·표준오차·신뢰수준과 갈라놓아 설명합니다. 그 논문은 결론을 끌어낼 때 신뢰구간이 p값 하나보다 훨씬 많은 것을 알려 준다고 맺습니다 (PMID 25742216).

그림을 눈으로 읽는 요령도 정리돼 있습니다. 2005년 한 논문이 오차막대 그림을 읽는 일곱 가지 규칙을 내놓았는데, 출발점은 심리학자들이 신뢰구간을 드물게 쓰고 잘 이해하지 못할 수 있다는 진단이었습니다. 규칙 가운데 일반 원칙은 셋입니다. 관심 있는 효과에 직접 대응하는 막대를 찾는 것, 실험 설계를 살피는 것, 구간을 해석하는 것입니다. 독립된 두 무리의 평균에 붙은 신뢰구간이 겹칠 때 무엇을 추론할 수 있는지에 대한 지침도 함께 내놓았습니다. 저자들은 구간으로 추정하는 방식을 더 널리 쓰면 연구 결과를 전하는 일이 크게 나아질 수 있다고 맺습니다 (PMID 15740449).

앞의 두 원칙, 곧 효과에 대응하는 막대를 찾는 것과 설계를 살피는 것을 이 글이 풀면 이렇습니다. 두 무리를 견주는 그림에서 궁금한 것은 두 평균의 차이입니다. 그런데 그림의 막대는 대개 무리 하나하나의 평균에 붙어 있어서, 차이에 대응하는 막대가 따로 없습니다. 또 같은 사람을 치료 전과 후에 두 번 잰 설계라면, 무리마다 그린 막대는 사람마다 얼마나 변했는지를 보여 주지 못합니다.

막대를 읽기 전에, 그림 설명에서 그 막대가 표준편차인지 표준오차인지 신뢰구간인지부터 찾으면 됩니다.

두 괄호가 겹치면 차이가 없는가

임질 치료제 시험 하나로 시작하겠습니다. 새로 나온 먹는 약을, 주사와 먹는 약을 함께 쓰는 기존 치료와 견준 3상 시험, 곧 허가 전 마지막 단계의 대규모 시험입니다. 세균이 사라진 비율은 새 약 쪽이 506명 중 90.9%(95% 신뢰구간 88.1~93.3)였습니다. 기존 치료 쪽은 238명 중 96.2%(92.9~98.3)였습니다. 두 괄호를 나란히 놓으면 92.9에서 93.3까지 겹칩니다. 보고된 두 괄호를 이 글이 견준 것입니다. 이렇게 겹친 것을 보고 「두 치료에 차이가 없다」고 읽기 쉽습니다.

그런데 같은 논문은 두 무리의 차이 자체에도 괄호를 붙여 두었습니다. 차이는 5.3%포인트이고, 그 괄호는 1.4~8.6입니다 (PMID 41391465). 이 괄호 안에는 「차이 없음」인 0이 없습니다. 각 무리의 괄호는 겹치는데, 차이의 괄호는 0을 비켜 갑니다. 차이에 붙은 괄호로 읽으면, 두 치료의 완치율 차이는 우연으로 넘기기 어렵다는 뜻입니다.

위에는 새 약 90.9%(88.1~93.3)와 기존 치료 96.2%(92.9~98.3)의 괄호가 92.9~93.3에서 겹친다. 아래에는 두 무리 차이 5.3%포인트의 괄호 1.4~8.6이 0 점선 오른쪽에 떨어져 있다.

이런 엇갈림이 생기는 까닭은 이렇습니다. 두 무리가 서로 다른 사람들로 이루어져 따로따로 흔들리는 경우를 독립된 두 무리라고 합니다. 이때 차이가 흔들리는 폭은, 두 괄호가 가운데에서 끝까지 뻗은 길이를 그냥 더한 것보다 좁습니다. 두 무리가 동시에 서로 반대쪽 끝까지 흔들릴 가능성은, 한 무리가 한쪽 끝까지 흔들릴 가능성보다 훨씬 작기 때문입니다. 그래서 겹침만 보면 실제로 있는 차이를 놓치기 쉽습니다.

독립된 두 무리의 평균에 붙은 신뢰구간이 겹친다고 해서, 참으로 있는 유의한 차이가 반드시 부정되는 것은 아닙니다. 겹치는 괄호가 낳는 혼란을 다룬 짧은 보고가 최근의 무작위 시험 하나를 예로 들어 이 점을 보입니다. 이 보고의 권고는 둘입니다. 연구자에게는, 실제 차이를 놓치는 일을 줄이도록 두 무리 평균의 차이를 직접 써서 신뢰구간을 구하라고 권합니다. 임상가에게는, 겹치는 괄호를 조심해서 해석하고 치료를 쓸지 정할 때 겹침이 늘 치료 효과의 차이 없음을 뜻한다고 가정하지 말라고 권합니다 (PMID 30119088).

겹침으로 판정하는 방식이 얼마나 놓치는지는 독성학의 모의실험이 쟀습니다. 독성학에서는 두 집단의 반수치사농도, 곧 절반이 죽는 농도를 견줄 때, 각각의 95% 신뢰구간이 겹치면 차이가 없다고 보기도 합니다. 이 겹침 검정은 0.05로 정해 둔 기준보다 훨씬 아래인 0.005 가까이에서 작동했습니다. 차이가 없는데도 있다고 잘못 판정하는 비율이 정해 둔 기준보다 훨씬 낮을 만큼 깐깐했다는 뜻이고, 그만큼 실제 차이를 잡아내는 힘이 떨어졌습니다. 두 농도의 비에 괄호를 붙여 1을 품는지 보는 방법은 정해 둔 0.05 기준에 맞게 작동했고, 실제 차이를 잡아내는 힘도 더 컸습니다. 저자들은 이 비 방법을 권합니다 (PMID 16704080).

겹침을 보는 것이 제자리인 일도 있습니다. 여러 연구의 결과가 서로 얼마나 어긋나는지를 판정할 때입니다. Core GRADE 지침은 이때 각 연구의 값들이 얼마나 다른지와 신뢰구간들이 얼마나 겹치는지를 함께 고려하고, 각 연구의 값이 판단의 문턱에 비해 어디에 놓였는지도 보라고 합니다 (PMID 40328467). 여러 연구가 어긋나는 정도를 가늠할 때는 겹침이 쓸모 있습니다. 겹침이 말썽을 부리는 쪽은 두 무리 사이에 차이가 있는지를 판정할 때입니다.

두 무리를 견줄 때 읽을 괄호는 각 무리의 괄호보다 두 무리의 차이에 붙은 괄호입니다.

「많이 나쁘지는 않다」를 보이는 시험 — 괄호의 어느 끝을 보나

앞의 임질 시험은 새 약이 기존 치료에 비해 열등하지 않다고 결론지었습니다. 차이의 괄호 1.4~8.6이 0을 품지 않고 전부 기존 치료가 나은 쪽에 놓여 있는데도 그렇습니다. 이 시험이 처음부터 다른 질문을 했기 때문입니다. 비열등성 시험은 새 치료가 기존 치료보다 미리 정한 만큼 넘게 나쁘지는 않다는 것을 보이려는 시험입니다.

비열등성 시험은 흔히 효능 말고 다른 장점이 있는 새 치료를 평가할 때 씁니다. 비열등성 마진은 「여기까지 나쁜 것은 받아들인다」고 시험 전에 그어 두는 선입니다.

이런 시험은 흔히 부실하게 보고되고 오해됩니다. 판정의 핵심은 둘입니다. 임상적으로 받아들일 마진을 미리 정하는 것, 그리고 새 치료와 기존 치료의 차이에 붙은 신뢰구간의 아래쪽 끝이 그 마진보다 위에 놓이는 것입니다. 이 판정은 새 치료가 기존 치료보다 나은지 못한지를 가리는 통상적인 분석과 다릅니다. 그래서 비열등성 요건을 충족한 치료가 통상적인 분석에서는 기존 치료보다 유의하게 나을 수도, 차이가 없을 수도, 유의하게 못할 수도 있습니다. 여기서 차이는 「새 치료 빼기 기존 치료」로 적은 것이라, 마진은 0보다 아래에 놓입니다. 이 내용을 정리한 종설은 비열등성 비교가 임상시험 보고에 중요한 보탬이지만, 통상적인 우월성 분석이 다루지 않는 여러 요소를 미리 따져야 한다고 맺습니다 (PMID 36104512).

임질 시험은 빼는 순서가 반대입니다. 차이를 「기존 치료 빼기 새 약」으로 정의했으니, 새 약이 나쁠수록 차이가 커지고 보아야 할 끝은 위쪽 끝입니다. 시험진은 이 괄호의 위쪽 끝이 12%포인트 마진보다 아래면 비열등으로 판정하기로 미리 정해 두었고, 위쪽 끝 8.6은 그 안쪽이었습니다. 저자들은 새 약이 비열등했고 안전성 양상도 비슷했으며, 합병증 없는 요로생식기 임질에 효과적인 먹는 치료 선택지가 될 가능성을 보여 준다고 결론지었습니다 (PMID 41391465). 저자들이 그렇게 적지는 않았지만, 차이의 괄호가 0을 비켜 갔으니 첫걸음 편에서 본 통상적인 읽기로는 기존 치료가 통계적으로 유의하게 나은 쪽입니다. 종설이 말한 「유의하게 못할 수도」가 바로 이런 경우입니다.

반대 방향의 예도 있습니다. 심하게 어긋난 손목뼈 골절을 입은 아이들을, 깁스만 하는 쪽과 수술로 뼈를 맞추는 쪽에 나눈 비열등성 시험입니다. 영국 49개 병원에서 4~10세 아이 750명이 참여했습니다. 이 시험은 차이를 「깁스 빼기 수술」로 정의했으므로, 차이가 음수일수록 깁스 쪽 팔 기능이 수술 쪽보다 나쁘다는 뜻입니다. 3개월 시점 팔 기능 점수 차이는 보정 후 평균 −1.64점이었고, 95% 신뢰구간은 −2.84~−0.44였습니다. 마진은 −2.5점이었고, 시험진은 이 값을 보수적으로 잡았다고 적었습니다. 연구가 내놓은 값 −1.64는 마진 안쪽인데, 괄호의 아래쪽 끝 −2.84가 마진 밖으로 나갑니다. 그래서 비열등성은 입증되지 않았고, 괄호 전체도 수술 쪽에 유리하게 놓였습니다. 다만 뼈가 완전히 어긋난 아이들(750명 중 329명)에서는, 이 무리를 위해 미리 정한 더 넓은 마진에 대해 비열등성과 맞는 결과가 나왔습니다.

시험진의 결론은 보수적인 마진에 대해 3개월 시점의 비열등성을 보이지 못했다는 것이고, 거기서 멈추지 않습니다. 관찰된 차이는 작았고, 가족들이 의미 있다고 여기는 문턱 아래였으며, 초기 회복 뒤에는 이어지지 않았습니다. 수술 쪽은 비용이 더 들었고(깁스 쪽이 환자당 평균 1,665파운드 적게 들었습니다), 시술 초기의 합병증이 있었으며, 겉모습이 나아진 정도는 크지 않았습니다. 이를 들어 시험진은 대부분의 아이에게 깁스를 먼저 쓰는 전략을 고려할 만하다고 결론지었습니다. 한편 12개월 안에 다시 부러진 아이는 깁스 쪽 9명, 수술 쪽 4명이었습니다 (PMID 41965242).

임질 시험에서는 괄호의 위쪽 끝을 봤고, 골절 시험에서는 아래쪽 끝을 봤습니다. 논리는 같고 방향만 반대입니다. 차이를 어느 쪽에서 빼느냐에 따라, 나쁜 쪽 끝이 위쪽 끝이 되기도 하고 아래쪽 끝이 되기도 합니다. 그래서 비열등성 시험을 읽을 때 먼저 확인할 것은 마진의 숫자보다 어느 쪽이 나쁜 방향인지입니다.

위 패널은 임질 시험의 차이(기존 빼기 새 약) 괄호 1.4~8.6과 오른쪽의 마진 12로, 위쪽 끝 8.6이 나쁜 쪽 끝이다. 아래 패널은 손목뼈 골절 시험의 차이(깁스 빼기 수술) 괄호 −2.84~−0.44와 왼쪽의 마진 −2.5로, 아래쪽 끝 −2.84가 나쁜 쪽 끝이다.

그다음으로 볼 것은 마진을 정한 방식입니다. 염증성 장질환 시험들을 예로 든 논평은, 설계 시점의 마진 선택이 비열등성 주장에 유리하도록 넓게 잡히는 쪽으로 치우칠 수 있다고 지적합니다. 마진이 넓을수록 「나쁘지 않다」는 판정을 받기 쉽기 때문입니다. 그래서 논평은 독자가 연구자가 정한 마진보다, 환자의 가치와 선호를 반영하는 마진을 기준으로 판단하기를 권합니다 (PMID 38159079).

마진을 미리 정해 두는 일은 흔하지만, 그 값을 왜 골랐는지 밝히는 일은 절반에 못 미칩니다. 위약(가짜 약) 무리를 둔 비열등성 시험 94편을 훑어보니, 마진을 미리 정한 시험은 96%였습니다. 그 마진을 정당화한 시험은 41%였습니다. 비열등성 설계를 택한 이유를 밝힌 시험은 22%, 마진과 신뢰구간을 그림으로 보여 준 시험은 23%였습니다. 저자들은 많은 시험에 방법의 투명성이 빠져 있다고 결론짓고, 앞으로의 시험은 설계와 마진을 택한 이유를 분명히 밝히라고 권합니다 (PMID 41940588).

비열등성 시험에서는 나쁜 방향의 끝이 마진 안쪽인지를 보고, 그 마진이 왜 그 값인지를 함께 보면 됩니다.

전문가도 괄호를 잘못 읽는가

신뢰구간 하나를 두고 쓴 해석 문장 여섯 개가 있습니다. 2014년의 한 조사는 심리학 연구자 120명과 학생 442명에게 이 문장들을 주고, 각각 참인지 거짓인지 표시하게 했습니다. 연구진의 분류로는 여섯 문장이 모두 거짓이었습니다. 그런데 두 무리 모두 평균 세 개 넘게 참이라고 표시했습니다. 연구자는 통계적 추론 교육을 전혀 받은 적이 없는 학생들을 거의 앞서지 못했습니다.

같은 조사에서, 연구자들이 스스로 밝힌 통계 경험은 성적과 관련이 없었습니다. 저자들은 많은 연구자가 신뢰구간의 올바른 해석을 모른다고 결론짓습니다. 그리고 p값과 신뢰구간이 심리학자들이 자료에서 결론을 끌어내는 주된 도구라서, 이 오해가 특히 안타깝다고 적습니다 (PMID 24420726).

이 결론에는 두 갈래의 비판이 붙었습니다. 첫째 갈래는, 응답자들이 문장을 자기 나름의 방식으로 그러나 올바르게 읽었을 수 있으니 오해의 증거가 못 된다는 비판입니다. 원래 조사의 저자들은 세 가지로 답했습니다. 하나는 그 대안 해석이 그 자체로는 옳아도 설문 문장을 받아들일 만하게 읽은 것이 못 된다는 것입니다. 무엇을 「같은 방식의 되풀이」로 칠지가 정해지지 않는다는, 잘 알려진 문제(준거 집합 문제) 때문입니다. 또 하나는 참가자들이 그런 해석을 염두에 뒀다는 근거가 자료에 없다는 것입니다. 마지막은 그 해석들이 신뢰구간 정의를 하찮게 되풀이한 것일 뿐이라, 참값이 어디 있는지에 대해서는 아무것도 말하지 않는다는 것입니다 (PMID 26620955). 이 세 논거는 원래 조사 저자들의 답변이고, 비판자들의 원문은 이 글이 확인한 자료에 들어 있지 않습니다.

둘째 갈래는 다른 연구진이 비판과 재현을 함께 실은 논문입니다. 이 논문의 첫 논거는 해석 자체입니다. 신뢰구간에는 두 가지 해석이 있으므로, 어떤 문장에 동의했다는 것만으로 오해했다고 추론할 수 없다는 것입니다. 두 번째 논거는 설계입니다. 여섯 문장이 모두 오해를 담은 문장이었고 응답자는 모든 문장에 답해야 했으니, 결과가 설계 때문에 만들어졌을 수 있다는 것입니다. 원래 자료를 다시 분석하니 1학년생과 석사과정 학생 사이에 설명하기 어려운 차이도 보였습니다.

그래서 이 연구진은 설문을 넓혀 다시 조사했습니다. 올바른 해석을 담은 문장 두 개를 더했습니다. 또 석사과정 학생에게는, 고를 수 있었다면 답하지 않았을 문장을 표시하게 했습니다. 알고 한 동의와 모르고 한 동의를 가르려는 장치입니다. 아직 배우지 않은 1학년생은 옳은 문장과 연구진이 틀렸다고 분류한 문장을 똑같은 비율로 골랐습니다. 두 종류의 문장이 겉보기만으로는 똑같이 그럴듯했다는 뜻입니다. 석사과정 학생은 모르고 한 응답을 걷어 내자 옳은 문장을 뚜렷이 더 많이 골랐습니다. 다만 모르겠다고 인정한 경우가 예상보다 많았습니다. 저자들은 가르치는 방식에 주는 함의를 논의하며 맺습니다 (PMID 27458424).

「얼마나 많은 사람이 틀리나」와 「설문이 그것을 제대로 쟀나」를 두고 2014~2016년에 다툼이 오갔고, 이 글이 확인한 자료에서는 결론이 난 흔적이 없습니다. 2016년 재현의 1학년생 결과는, 배우지 않은 사람에게는 옳은 해석과 틀린 해석이 겉보기로 가려지지 않는다는 것을 보여 줍니다. 배운 뒤에 얼마나 가려지는지가 두 쪽이 다투는 자리입니다.

괄호를 바르게 읽어도 답하지 못하는 물음이 하나 남습니다. 치료를 고르는 사람이 궁금한 것은 「이 치료가 이로울 확률」일 때가 많습니다. p값과 신뢰구간은 치료 효과를 간접적으로 평가하는 확립된 도구이지만, 그 확률을 직접 추정하지는 않습니다. 앞선 근거와 관찰한 자료를 합쳐 그 확률을 직접 내는 다른 통계 틀이 있습니다. 재활 연구에 이 틀을 소개한 관점 논문은, 이 방법이 전통적 분석을 보완한다고 결론짓습니다. 같은 논문은 그 결론이 앞선 근거에 대한 가정에 달려 있고, 엄밀한 시험 설계와 기존 방식의 추론, 반복 검증을 대신하지 못한다고 덧붙입니다 (PMID 42366482).

신뢰구간을 올바르게 해석하는 일은 훈련받은 연구자에게도 쉽지 않다는 보고가 있고, 그 정도를 두고는 다툼이 있었습니다.

괄호를 만나면 물을 것

첫걸음 편은 괄호를 만나면 「가장 작게 잡으면 얼마?」와 「가장 크게 잡으면 얼마?」 두 가지를 묻게 했습니다. 이 글은 그 위에 네 물음을 더합니다.

  1. 괄호가 판단이 바뀌는 문턱을 몇 개 넘는지 봅니다.
  2. 그림의 막대라면, 그 막대가 표준편차인지 표준오차인지 신뢰구간인지를 그림 설명에서 찾습니다.
  3. 두 무리를 견준 결과라면, 각 무리의 괄호가 겹치는지보다 차이에 붙은 괄호를 찾습니다.
  4. 비열등성 시험이라면, 차이를 어느 쪽에서 뺐는지 확인해 나쁜 방향의 끝을 마진에 대 보고, 그 마진을 정한 이유가 적혀 있는지 봅니다.

여러 연구의 괄호를 한 그림에 모아 읽는 법은 「메타분석은 평균을 내지 않는다 — 숲그림의 마름모가 만들어지는 법」이 다룹니다. p값이 무엇의 확률인지는 「p=0.03은 무엇의 확률인가 — p값이 답하는 하나의 질문」이, 유의성이 몇 명에 달려 있는지는 「0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법」이 다룹니다.

괄호를 읽는 일은 두 숫자를 확인한 뒤, 무엇의 괄호이고 어느 끝이 판단을 가르는지를 묻는 데까지 갑니다.

근거 논문

  • "Anaesthesia/analgesia for manual removal of retained placenta." (2020) — PMID 32529658 — 코크런 리뷰. 시험 1편·30명, 1.50(0.71–3.16). 근거 불충분·질 매우 낮음(설계 한계·비정밀성), 다기관 시험 필요.
  • "The many roles of decision thresholds…" (2026) — PMID 41314355 — 논평. GRADE 비정밀성 판정에서 신뢰구간이 넘는 결정 문턱의 수가 등급 하향 정도를 정하는 데 쓰인다. 문턱은 해석·확실성 평가·연구 설계에서 여러 역할을 한다.
  • "A primer on confidence intervals in psychopharmacology." (2015) — PMID 25742216 — 입문. 신뢰구간을 표준편차·표준오차·신뢰수준과 구별하고, 신뢰구간이 p값보다 훨씬 많은 정보를 준다고 결론.
  • "Inference by eye: confidence intervals and how to read pictures of data." (2005) — PMID 15740449 — 오차막대 그림을 읽는 7가지 규칙과 독립 집단 겹침 지침. 구간 추정이 연구 소통을 크게 낫게 할 수 있다고 결론.
  • "Zoliflodacin versus ceftriaxone plus azithromycin…" (2026) — PMID 41391465 — 3상 비열등성 시험. 완치 90.9%(88.1–93.3) 대 96.2%(92.9–98.3), 차이 5.3%(1.4–8.6), 상한이 12% 마진 안쪽. 비열등·안전성 유사, 먹는 치료 선택지 가능성.
  • "A Tale of Confusion From Overlapping Confidence Intervals." (2019) — PMID 30119088 — 짧은 보고. 두 독립 집단 평균의 구간이 겹쳐도 참된 차이가 반드시 부정되지 않는다. 차이 자체의 구간을 구하고 겹침을 차이 없음으로 가정하지 말라고 권고.
  • "Comparing median lethal concentration values using confidence interval overlap or ratio tests." (2006) — PMID 16704080 — 모의실험. 겹침 검정은 0.005 가까이에서 작동해 검정력을 잃고, 비 검정이 명목 수준에 맞고 검정력도 크다.
  • "Core GRADE 3: rating certainty of evidence-assessing inconsistency." (2025) — PMID 40328467 — 연구 간 불일치 판정에서 점추정치 차이와 신뢰구간 겹침을 함께 본다.
  • "Interpreting the results of noninferiority trials-a review." (2022) — PMID 36104512 — 종설. 차이 구간의 하한이 마진 위에 있어야 하고, 요건을 충족한 치료가 유의하게 열등할 수도 있다. 중요한 보탬이되 여러 요소를 미리 따져야 한다.
  • "Non-surgical casting versus surgical reduction… (the CRAFFT Study)" (2026) — PMID 41965242 — 750명. 차이 −1.64(−2.84~−0.44)가 보수적 마진 −2.5를 넘어 비열등성 미입증. 차이는 작고 지속되지 않았으며 수술은 비용·초기 합병증이 더해 깁스 우선 전략을 고려할 만하다고 결론.
  • "The Clinical Interpretation of Noninferiority Trials." (2024) — PMID 38159079 — 논평. 마진 선택이 넓은 쪽으로 치우칠 수 있어 환자의 가치·선호를 반영한 마진으로 판단하라고 권한다.
  • "The evolving role of placebo in non-inferiority trials: A scoping review." (2026) — PMID 41940588 — 위약군 비열등성 시험 94편. 마진 사전 지정 96%, 정당화 41%. 투명성 부족, 설계·마진 정당화 필요.
  • "Robust misinterpretation of confidence intervals." (2014) — PMID 24420726 — 연구자 120명·학생 442명이 거짓 진술 6개 중 평균 3개 넘게 지지, 연구자가 학생을 거의 앞서지 못했다.
  • "Continued misinterpretation of confidence intervals: response to Miller and Ulrich." (2016) — PMID 26620955 — 원저자 답변. 대안 해석은 문항의 수용 가능한 독법이 못 되고, 근거가 없으며, 모수의 위치를 함의하지 않는다.
  • "The Interpretation of Scholars' Interpretations of Confidence Intervals…" (2016) — PMID 27458424 — 비판·재현. 두 해석·강제 응답 설계를 문제 삼고, 재현에서 1학년생은 옳은/틀린 문항을 같은 비율로, 석사생은 모르는 응답을 걷어 내자 옳은 문항을 더 지지했다.
  • "Bayesian Thinking in Rehabilitation Research." (2026) — PMID 42366482 — 관점 논문. p값·신뢰구간은 치료가 이로울 확률을 직접 추정하지 않는다. 그 확률을 내는 방법은 보완적이나 사전 가정에 의존하고 설계·기존 추론·재현을 대신하지 못한다.
📚 논문 통계 읽기 — p값부터 메타분석까지
3 / 16
  1. 1.p=0.03은 무엇의 확률인가 — p값이 답하는 하나의 질문
  2. 2.0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법
  3. 3.신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법
  4. 4.오즈비는 위험비가 아니다 — '몇 배'가 무엇의 몇 배인가
  5. 5.어떤 연구는 위험을 셀 수 없다 — 설계가 지표를 정하고, 층을 합치면 값이 달라진다
  6. 6."위험 50% 감소"는 몇 명인가 — 상대위험·절대위험·NNT를 읽는 법
  7. 7.같은 결과, 다른 문장 — 형식이 판단을 바꾸는 자리와 바꾸지 못하는 자리
  8. 8."연령·성별·BMI 보정"은 무엇을 했나 — 교란과 보정을 읽는 법
  9. 9.보정하면 안 되는 것 — 어떤 변수는 넣는 순간 답이 바뀐다
  10. 10.보정을 다 하고 나서 남는 것 — E-value·음성대조·성향점수가 하는 일과 하지 않는 일
  11. 11.해저드비 0.7은 무엇의 0.7인가 — 생존곡선 읽는 법
  12. 12.그 사람들은 언제부터 세어졌나 — 관찰연구가 효과를 만들어내는 방식
  13. 13.끝까지 따라가지 못할 때 — 치료를 바꾼 사람, 다른 이유로 떠난 사람
  14. 14.메타분석은 평균을 내지 않는다 — 숲그림의 마름모가 만들어지는 법
  15. 15.I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법
  16. 16.같은 시험, 다른 결론 — 출판편향과 "무엇을 합쳤는가"
← 이전 글0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법다음 글 →오즈비는 위험비가 아니다 — '몇 배'가 무엇의 몇 배인가

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.