
Paperis 아티클
0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법
0.05는 계산에서 나온 값이 아니라 합의된 관습입니다. 고영향 저널에서 초록에 유의한 결과를 보고한 무작위시험 399편에서, 유의성이 사라지는 데 필요한 환자 수의 중앙값은 8명이었고 넷 중 하나는 3명 이하였습니다.
0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법
참가자 100명짜리 임상시험이 있다고 해 보겠습니다. 두 치료를 비교했고 결과는 p = 0.006이었습니다. p값은 효과가 전혀 없다면 이만한 차이나 그보다 큰 차이가 우연히 얼마나 자주 나오는지를 나타내는 값입니다. 이 값은 흔히 기준으로 삼는 0.05보다 한참 작습니다. 논문에는 "유의한 차이가 있었다"고 적히고, 이 숫자를 본 사람은 결론이 꽤 단단하다고 느낍니다.
그런데 이 시험에서 아무 일 없던 환자 4명에게 사건이 일어났다면, p는 0.05를 넘어갑니다. 환자 4명의 결과만 달랐어도 "유의함"이 사라진다는 뜻입니다. 이렇게 유의성을 사라지게 하는 최소 인원이 이 글의 첫 번째 용어인 취약성 지수입니다.
이 시험은 실제 시험이 아닙니다. 한 논문이 계산을 눈에 보이게 하려고 만든 가상의 예입니다. 그리고 그 논문은 이 숫자를 쓰는 방식을 비판하려고 이 예를 만들었습니다 (PMID 38777001). 그 비판은 글 뒷부분에서 다룹니다. 이 글은 처음부터 논쟁 안에 서 있습니다.
p값이 답하는 질문은 하나뿐이고, 그 질문은 "결과가 우연일 확률"이 아닙니다. 이 이야기는 「「통계적으로 유의했다」는 무엇을 말하나 — 동전 던지기로 읽는 p값」에서 다뤘습니다. 이 글은 그다음 질문 두 개를 다룹니다. 왜 하필 0.05인가. 그리고 그 선을 넘었다는 결과는 실제로 몇 명 위에 서 있나.
이 글에서 새로 배울 말은 다섯 개이고, 각 말은 처음 나오는 자리에서 풉니다.
⚠️ 아래에 나오는 질환·시술 이름은 어느 분야의 시험을 몇 편 세어 봤는지를 알려 주는 이름표입니다. 치료의 좋고 나쁨에 대한 판단이 아닙니다.
0.05는 계산에서 나온 값이 아니다
0.05는 자연의 상수가 아니고, 수식을 풀어 나온 값도 아닙니다. 사람들이 쓰다 보니 굳어진 관습입니다. p값의 역사를 짧게 정리한 한 개관은 그 과정을 이렇게 적습니다. 실무자들은 자기들에게 잘 맞는 간단한 방법을 아주 빨리 찾아냈습니다. 통계학자들은 그 열기를 굳이 누를 필요를 못 느꼈는데, 다들 합의한 것처럼 보였기 때문입니다 (PMID 41748420).
같은 개관은 0.05를 "임의적인데도 신성한" 문턱이라 부릅니다. 그리고 p<0.05 관행의 함정을 다섯 가지로 정리합니다. 결과를 흑백으로 가르는 이분법, 없는 효과를 있다고 할 가능성, 효과가 얼마나 큰지 알려 주지 않는 점, 환자에게 의미 있는 차이인지 알려 주지 않는 점, 맥락을 떠나 쓰이는 점입니다. 개관의 결론은 p값을 버리자는 것이 아닙니다. 버리자는 대상은 0.05라는 문턱과 "통계적 유의성"이라는 용어입니다 (PMID 41748420).
첫 번째 함정인 이분법에서 이 글의 두 번째 용어가 나옵니다. 이분화는 연속적인 숫자를 어느 선에서 잘라 두 칸으로 만드는 일입니다. 키를 재서 "170cm 이상"과 "미만"으로 나누는 것과 같습니다. p값에서는 자르는 선이 0.05이고, 두 칸의 이름이 "유의함"과 "유의하지 않음"입니다. 자르고 나면 0.049와 0.051은 다른 칸에, 0.049와 0.001은 같은 칸에 들어갑니다.

문턱을 없애자는 쪽은 숫자 하나를 특히 강조합니다. 그 숫자를 읽으려면 세 번째 용어가 필요합니다. 검정력은 실제로 효과가 있을 때 그것을 "유의하다"고 잡아낼 확률입니다. 시험을 설계할 때는 흔히 80%를 목표로 잡습니다. 같은 시험을 다섯 번 하면 네 번은 효과를 잡아낸다는 뜻입니다.
그 양호한 80%에서도 두 연구의 결과가 엇갈리는 일이 흔합니다. 참 효과가 있는데도 한 연구는 유의하고 다른 연구는 유의하지 않을 확률이 3분의 1입니다 (PMID 28698825). 같은 효과를 두 번 재도 세 번에 한 번은 "있다"와 "없다"로 갈린다는 뜻입니다.
이 논문의 결론은 고정된 문턱을 없애자는 것입니다. 대신 p값을 연속적인 눈금으로 읽자고 합니다. 그 눈금이 나타내는 것은 "차이가 없다"는 가정에 반하는 증거가 얼마나 센가입니다. 통계학에서는 이 가정을 귀무가설이라고 부릅니다. 저자들은 이 읽기가 고(故) 로널드 피셔의 권고와 일치한다고 적습니다 (PMID 28698825).
같은 논문은 반대 논거도 나란히 검토합니다. 반대 논거는 세 가지입니다. 결정 규칙을 오히려 더 엄격하게 해야 한다는 것, 문턱이 없어지면 표본 크기가 줄어들 수 있다는 것, 아예 p값 자체를 버리는 편이 낫다는 것입니다. 이 셋을 검토한 뒤 저자들은 어느 방법이 옳은지를 고르지 않습니다. 저자들의 결론은 어떤 추론 방법을 쓰든 이분법적 문턱 사고가 사람의 판단에 자리를 내주어야 한다는 것입니다 (PMID 28698825). 0.05를 버리자고 적은 앞의 개관도 대안 목록에 "더 엄격한 문턱"을 올려 둡니다 (PMID 41748420).
문턱 유지를 정면으로 옹호하는 개관도 있습니다. 논거는 임상 연구가 의사결정을 이끌려면 이분법적 답이 필요하다는 것이고, 특히 진단영상과 중재시술에서 그렇다고 봅니다. 문턱을 0.005로 낮추자는 제안에는 반대합니다. 그러면 연구 비용이 올라가고, 지원금 없는 자발적 연구가 줄 수 있다는 이유입니다 (PMID 32157489).
이 개관은 0.05를 그대로 두자고 합니다. 그 문턱에 따르는 거짓 발견과 재현 실패는 문턱을 낮추는 대신 다른 방법으로 줄이는 편이 낫다고 봅니다. 그 방법은 체계적 고찰·메타분석 같은 2차 근거, 데이터 공유, 비용효과 분석입니다. 그리고 p값을 보고할 때는 「p < 0.05」만 적지 말고 실제 값을 적으라고 덧붙입니다 (PMID 32157489).
실제로 나온 제안은 이렇게 갈립니다. 한쪽은 문턱을 아예 없애자고 합니다 (PMID 28698825, PMID 41748420). 다른 쪽은 결정이 걸린 자리에서 문턱을 지우기보다 다른 기준을 덧붙이자고 합니다. 뒤쪽의 예가 신약 개발의 개념증명 시험입니다. 개념증명 시험은 신약 개발을 계속할지 중단할지를 정하는 시험입니다. 이 문제를 다룬 논문은 이런 자리에서 유의성 검정만으로 기준을 세우는 것은 부적절하다고 봅니다. 그래서 베이즈 틀로 기준을 다시 짜고, 대조군보다 낫다는 것과 효과 크기가 의미 있을 만큼 크다는 것을 함께 요구하는 이중 기준을 제안합니다 (PMID 30222466).
이 글은 "0.05를 버려야 한다"고 말하지 않습니다. 0.05는 합의된 관습이고, 그 관습을 유지할지는 지금도 논쟁 중입니다. 두 진영이 공통으로 요구하는 것도 있습니다. 폐지론 쪽은 유의/비유의라는 두 칸 대신 효과의 크기와 그 그럴듯한 범위를 함께 읽자고 합니다 (PMID 41748420, PMID 28698825). 유지론 쪽은 "p<0.05"만 적지 말고 실제 값을 적으라고 요구합니다 (PMID 32157489).
취약성 지수 — 몇 명이면 유의성이 사라지나
p=0.04와 p=0.06이 얼마나 다른지는 숫자만 봐서는 감이 오지 않습니다. 이 차이를 사람 수로 옮기려고 만든 것이 취약성 지수입니다. 취약성 지수는 한 군에서 결과가 "사건 없음"에서 "사건 있음"으로 바뀌어야 하는 최소 인원으로, 그만큼 바뀌면 결과의 유의성이 사라집니다. 숫자가 작을수록 결론이 몇 사람 위에 얹혀 있다는 뜻입니다. 앞의 100명짜리 예에서는 이 값이 4였습니다.
이 지수가 세는 것은 유의성이 사라지는 인원입니다. 결론이 반대로 뒤집히는 인원은 아닙니다. p가 0.05를 넘어가면 "유의함"이라는 이름표가 떨어질 뿐, 효과의 방향이 반대가 되지는 않습니다.
이 값은 쓸 수 있는 자리가 좁습니다. 두 군을 반씩 나눈 시험에서, 있었다·없었다로 세는 결과에만 계산할 수 있습니다 (PMID 31822121). 급성 관상동맥증후군 진료지침이 인용한 무작위 시험은 407편이었습니다. 그중 이 조건을 갖추고 결과도 유의해서(P < 0.05) 이 값을 낼 수 있었던 시험은 132편(32.4%)이었습니다 (PMID 36882068). 적어도 이 진료지침의 근거에서는 취약성 지수가 3분의 1쯤의 시험에만 쓸 수 있는 자였습니다.
취약성 지수라는 이름을 붙인 논문이 이 글의 중심 숫자를 내놓았습니다. 이 논문은 많이 인용되는 주요 의학저널의 무작위 대조시험 중 초록에 유의한 결과를 하나 이상 보고한 399편을 검토했습니다. 취약성 지수의 중앙값은 8이었고, 범위는 0~109였습니다. 4분의 1은 3 이하였습니다. 넷 중 하나는 환자 세 명의 결과만 달랐어도 "유의함"이 사라졌을 연구라는 뜻입니다.
같은 논문이 하나를 더 적었습니다. 연구 도중 연락이 끊겨 결과를 모르게 된 사람을 추적 소실이라고 부릅니다. 전체 시험의 53%에서는 취약성 지수가 추적 소실 인원보다 작았습니다 (PMID 24508144). 결과를 모르는 사람이 유의성을 지우는 데 필요한 인원보다 많았다는 뜻입니다. 다만 이 두 숫자를 나란히 놓는 비교 자체가 지금은 부적절하다는 지적을 받고 있습니다. 그 지적은 글 뒷부분에서 다룹니다.
분야마다 얼마나 되나
이 계산은 여러 분야로 퍼졌습니다. 아래 표는 각 연구가 모은 시험들에서 보고한 값입니다. 연구마다 본 시험 수가 다르므로, 6편을 본 연구와 1,007편을 본 연구를 같은 무게로 놓을 수는 없습니다. 그리고 이 값은 애초에 유의한 결과가 나온 시험에만 붙습니다. 괄호 안은 시험을 지수 순으로 줄 세웠을 때 가운데 절반이 걸친 범위입니다.

| 대상 | 시험 수 | 취약성 지수 중앙값 (가운데 절반의 범위) | 출처 |
|---|---|---|---|
| 고영향 저널 5종(2014~2021, 유의한 결과 보고분) | 643편 | 12 (3–28) | PMID 35820586 |
| 허혈성 뇌졸중† | 25편 | 7 (4–15) | PMID 30765294 |
| 조산아 | 66편 | 3 (1–5) | PMID 35615631 |
| 외과 전반(여러 리뷰 종합) | 1,007편 | 3 (1–7) | PMID 36719446 |
| 난원공개존 폐쇄 | 6편 | 0 (재발 뇌졸중을 결과로 볼 때, 0–5.3) | PMID 30890394 |
† 허혈성 뇌졸중 행은 저자들이 자기 값을 견고한 편으로 해석한 경우입니다. 저자들은 중앙값 7이 다른 임상 분야의 2.5보다 높다고 적고, 결론을 "이 분야의 많은 시험이 다른 분야에 비해 괜찮은 수준의 견고성을 가진다"로 맺었습니다 (PMID 30765294).
표에서 뺀 행도 하나 있습니다. 어깨 관절치환 13편을 본 연구는 중앙값 6을 "다른 정형외과 세부전공보다 높은 값"이라 적었습니다. 그런데 그 값은 시험 하나하나가 아니라 결과 하나하나를 단위로 계산됐고, 그 결과의 89.7%는 애초에 비유의했습니다. 단위가 달라 표에서 뺐습니다 (PMID 33271323).
표의 숫자는 각 연구의 보고값이고, 그 값을 어떻게 읽을지는 논문마다 다릅니다. 난원공개존 폐쇄 행은 허혈성 뇌졸중 행과 반대로 읽힌 경우입니다. 저자들은 이 값을 근거로 "최근의 긍정적 결과들은 취약한 성격 때문에 신중히 해석해야 하며 개별화된 의사결정이 중요하다"고 결론지었습니다 (PMID 30890394).
좋아지고는 있다
표 첫 행의 중앙값 12는 10년 전 같은 저널들의 8보다 유의하게 나아진 값입니다(p<0.001). 그런데 가운데 절반의 아래쪽 끝은 3에서 그대로입니다. 지금도 시험의 4분의 1은 유의성이 사건 3건 이하에 걸려 있습니다 (PMID 35820586).
같은 논문은 우산 리뷰도 함께 했습니다. 우산 리뷰는 여러 체계적 문헌고찰을 다시 모아 보는 리뷰입니다. 이 우산 리뷰는 15개 진료과의 체계적 문헌고찰 57편을 모았고, 진료과마다 시험이 10~692편 들어 있었습니다. 모든 분과에서 취약성 지수의 중앙값은 2~4 사이였습니다 (PMID 35820586).
취약성 지수에는 미리 알아 둘 성질이 하나 있습니다. 취약성 지수는 p값과 강하게 얽혀 있습니다. 조산아 시험 66편에서 지수와 p값의 상관계수는 −0.857이었습니다 (PMID 35615631). p값이 작은 시험일수록 취약성 지수가 컸다는 뜻입니다. 이 얽힘이 뒤에 나올 비판의 출발점입니다.
"차이 없음"도 몇 명에 달려 있다
같은 계산을 반대 방향으로도 할 수 있습니다. 역-취약성 지수는 비유의한 결과를 유의하게 만드는 데 필요한 최소 인원입니다. 계산도 뜻도 같고 방향만 반대라 이름도 뒤집었습니다.
성형외과 무작위 시험 중 차이 없음을 보고한 40편을 본 연구가 있습니다. 이 시험들의 1차 결과, 곧 연구가 가장 중요하게 미리 정한 결과는 65개였습니다. 표본 중앙값은 76명, 사건 수 중앙값은 10건이었습니다. 역-취약성 지수 중앙값은 4였습니다. 절반은 참가자 네 명의 사건 상태만 달랐어도 "유의함"이 됐을 결과라는 뜻입니다 (PMID 39850534).
같은 연구가 덧붙인 사실이 더 중요합니다. 40편 중 21편은 검정력 분석을 아예 하지 않았습니다. 검정력 분석은 앞에서 본 검정력을 목표 수준에 맞추려면 몇 명이 필요한지 미리 계산하는 일입니다. 저자들의 결론은 이 "차이 없음"들이 적은 수의 사건 위에 얹혀 있다는 것, 그리고 이 지표가 p값을 보완한다는 것입니다 (PMID 39850534).
벨마비에 스테로이드와 항바이러스제를 함께 쓴 시험에서는 두 방향을 나란히 볼 수 있습니다. 시험 11편에서 회복 관련 결과가 57개 나왔습니다. 그중 유의했던 결과는 7개였고, 이들의 평균 취약성 지수는 2.714였습니다. 비유의했던 결과는 50개였고, 이들의 평균 역-취약성 지수는 5.960이었습니다. 저자들의 결론은 이 병용요법의 근거가 엇갈리는 효과와 높은 취약성을 보이고 특히 유의했던 쪽이 그렇다는 것, 그래서 더 견고한 연구가 필요하다는 것입니다 (PMID 40741786).
취약성 지수가 낮다는 것은 "이 자료만으로는 어느 쪽도 단단히 말할 수 없다"는 뜻입니다. "그 치료가 듣지 않는다"는 뜻은 아닙니다.
그런데 취약성 지수 자체가 논쟁 중이다
취약성 지수를 비판하는 문헌도 나란히 있고, 일부는 위에서 인용한 계산 방식 자체를 겨눕니다. 가장 큰 규모의 비판은 시뮬레이션에서 나왔습니다. 흔한 시험 조건 범위 안에서 컴퓨터로 가상의 무작위 시험 30만 건을 만들어 분석한 연구입니다. 결과는 두 가지입니다.
첫째, 시험마다 취약성 지수가 다른 까닭의 79.8%를 p값 하나가 설명했습니다(역-취약성 지수에서는 71.9%). 지수가 크고 작은 것이 대부분 p값의 크고 작음에서 나온다는 뜻입니다. 저자들의 결론은 취약성 지표가 표본 크기·사건 수·p값을 수학적으로 되비친 것이지, 견고성의 독립적인 척도가 아니라는 것입니다.
둘째는 추적 소실과의 비교입니다. 연락이 끊긴 사람을 다시 자료에 넣어 유의성을 실제로 잃게 하려면 몇 명이 필요한지 계산했더니, 그 인원이 지수보다 큰 경우가 84.9%였습니다. 반대 방향에서는 95.5%였습니다. 추적 소실 인원이 지수보다 많다고 해서 유의성이 사라진다고 볼 수 없다는 뜻입니다. 그래서 저자들은 취약성 지수와 추적 소실 인원을 직접 비교하는 것은 통계적으로 부적절하며 앞으로 피해야 한다고 결론짓습니다 (PMID 42605132).
같은 지적이 문헌 감사에서도 나왔습니다. 문헌 감사는 이미 나온 논문들의 서술을 모아 점검하는 연구입니다. 정형외과에서 이 지수를 쓴 연구는 39편이었습니다. 그중 37편(95%)이 지수를 추적 소실 인원과 직접 비교했고, 그중 22편(59%)에 부정확하거나 오도하는 진술이 있었습니다 (PMID 38777001).
이 글을 연 100명짜리 가상 시험이 이 감사에서 나왔습니다. p=0.006, 지수 4인 그 시험에서 유의성이 실제로 사라지려면 추적 소실 환자 7명을 되돌려 넣어야 했습니다. 지수의 거의 두 배입니다. 이미 있는 환자 한 명의 결과를 뒤집는 것과, 연락이 끊긴 환자 한 명을 새로 넣는 것은 p값을 같은 크기로 움직이지 않기 때문입니다 (PMID 38777001).

이 논문의 결론은 이렇습니다. "추적 소실 인원이 취약성 지수를 넘으면 그 시험은 유의성을 잃을 수 있다"는 주장은 흔히 부정확하며, 정형외과에서 이런 주장이 만연해 있습니다. 이전의 취약성 리뷰들이 주장한 만큼 시험들이 취약하지 않을 수 있습니다. 다만 저자들은 곧바로 덧붙입니다. 어떤 개별 시험의 값어치는 그 시험이 수행된 맥락과 잠재적 편향, 결과를 함께 보는 총체적 접근으로만 판단할 수 있다는 것입니다 (PMID 38777001).
견고한 시험도 많다
취약성 지수가 큰 분야도 있습니다. 척수자극술 무작위 시험 30편의 통증 결과에서 중앙값은 5.45였고, 저자들은 대다수가 견고한 시험이라고 결론지었습니다 (PMID 41376548).
이 지표를 어떻게 쓰면 되는지는 심부전 시험 두 편에서 잘 드러납니다. 대상은 심장이 피를 짜내는 힘이 유지되었거나 조금만 떨어진 심부전 환자이고, 시험은 SGLT2 억제제를 쓴 EMPEROR-Preserved와 DELIVER입니다. 이 시험들을 본 연구의 저자들은 배경에 먼저 이렇게 적어 둡니다. 이 약은 모든 심부전 유형에서 심혈관 사망과 심부전 입원을 줄입니다. 다만 이 두 유형에서는 이득의 크기와 견고성이 크지 않습니다 (PMID 41314931).
숫자는 이렇습니다. 심부전 입원과 심혈관 사망을 합친 결과에서 취약성 지수는 37과 41이었습니다. 심부전 입원 단독은 37과 46이었습니다. 둘 다 견고한 값입니다. 그런데 같은 시험에서 사망 쪽 값은 10 이하였습니다. 같은 시험 안에서도 어떤 결과를 보느냐에 따라 견고성이 이렇게 갈립니다. 저자들의 결론은 이 약이 심부전 입원을 일관되게 줄이지만, 이 두 집단에서는 사망 이득의 견고성이 여전히 불확실하다는 것입니다 (PMID 41314931).
한 걸음 더 나아가, 증거를 세 축으로 나란히 놓고 보자는 제안도 나왔습니다. 세 축은 p값, 취약성, 견고성입니다. 여기서 견고성은 결과가 "효과 없음"에서 얼마나 멀리 떨어져 있는지를 뜻합니다. 이 제안은 15개 진료과에서 두 군·있음/없음 결과 시험 129편을 모아, 72만 건의 모의 시험과 대조했습니다. 이 중 유의했던 시험은 77편이었습니다. 그중 30편(39.0%)은 세 기준을 모두 통과했고, 61.0%(47편)는 취약했습니다 (PMID 41480455).
이 결과에는 한정어가 붙습니다. 이 모의 시험은 출판 편향이나 선택적 보고를 계산에 넣지 않은 무작위 생성입니다. 그리고 저자들도 이 틀이 증거의 등급을 나눌 뿐 참인지·인과인지·재현될지를 증명하지는 않는다고 못박습니다 (PMID 41480455).
이 제안은 0.05를 없애지 않았습니다. p ≤ 0.05를 세 기준 중 하나로 남기고, 그 옆에 기준 두 개를 더 세웠습니다.
그래서 어떻게 써야 하나
비판을 다 듣고 나면 이 도구의 자리가 오히려 분명해집니다. 취약성 지수는 견고성에 대한 새로운 정보를 주지 않습니다. 그 값의 대부분은 p값·표본 크기·사건 수에서 계산되어 나옵니다 (PMID 42605132). 지수를 추적 소실 인원과 같은 것으로 놓고 견주는 흔한 해석도 부정확한 경우가 많습니다. 저자들의 말로는 둘은 같지 않습니다 (PMID 38777001).
취약성 지수가 하는 일은 같은 정보를 사람이 감각할 수 있는 단위로 번역하는 것입니다. "p=0.04"에는 감각이 없지만 "환자 세 명"에는 감각이 있습니다. 이 지표를 계산한 연구들이 "p값과 함께 보고하라"고 적는 이유도 그것입니다 (PMID 24508144, PMID 35820586). 이 글이 이 지수를 끌어온 이유도 같습니다. 판정하려는 것이 아니라, p<0.05라는 문장이 얼마나 얇은 것 위에 설 수 있는지를 눈에 보이게 하려는 것입니다.
흔한 오해 둘
① "0.049와 0.051은 다른 세계다"
이 오해는 앞에서 본 이분화에서 나옵니다. 자르고 나면 두 값이 다른 칸에 들어가지만, 그 사이에 절벽이 있는 것은 아닙니다. 문턱을 없애자는 쪽의 논거도 여기서 나옵니다. 검정력이 이상적이지 않으면, 유의하다고 나온 결과의 효과 크기는 실제보다 크게 부풀려집니다. 그 부풀려진 결과만 해석하고 비유의한 결과를 무시하면 잘못된 결론에 이릅니다 (PMID 28698825).
그래서 이 논문은 큰 p값을 읽는 법도 적습니다. 큰 p값도 "차이가 없다"는 가정에 반하는 어느 정도의 증거입니다. 그러니 큰 p값을 그 가정을 지지하는 근거로 뒤집어 읽어 "효과가 없다"고 결론지을 수는 없습니다 (PMID 28698825).
여기서 네 번째 용어가 나옵니다. 재현은 같은 연구를 다시 해 보는 일입니다. 앞에서 본 숫자를 다시 놓아 보겠습니다. 검정력 80%에서도 두 연구가 엇갈릴 확률이 3분의 1입니다. 그러니 다시 해 본 연구가 비유의하다는 이유만으로 재현에 실패했다고 해석할 수는 없습니다 (PMID 28698825).
② "한 편의 유의한 결과는 사실이다"
이 절의 문헌들은 서로 반박하고 있어서, 한쪽만 떼어 읽으면 정반대의 결론에 이릅니다. 시작은 유명한 논문 한 편입니다. 이 논문은 어떤 연구 주장이 참일 확률이 몇 가지에 달려 있다는 틀을 세웠습니다. 검정력과 편향, 같은 질문을 다룬 다른 연구의 수, 그리고 무엇보다 그 분야에서 검증되는 관계들 중 참인 것의 비율입니다 (PMID 16060722).
이 틀에 따르면 참일 확률이 낮아지는 조건이 여럿 있습니다. 연구가 작을수록, 효과 크기가 작을수록, 검정되는 관계가 많고 사전 선별이 적을수록 그렇습니다. 설계·정의·결과·분석 방식의 유연성이 클수록, 이해관계가 클수록도 그렇습니다. 이 에세이는 시뮬레이션을 근거로, 대부분의 설계와 상황에서 연구 주장이 참이기보다 거짓일 가능성이 크다는 결론에 이릅니다 (PMID 16060722). 뒤에 나올 반박들이 겨누는 것이 바로 이 결론입니다.
저 목록의 "유연성"을 줄이려고 나온 관행이 다섯 번째 용어입니다. 사전등록은 자료를 보기 전에 무엇을 어떻게 재고 분석할지를 공개된 곳에 미리 적어 두는 일입니다. 미리 적어 두면 결과를 본 뒤에 분석을 고르기가 어려워집니다.
저 논문은 논쟁의 시작이었고, 논쟁은 그 뒤로도 이어졌습니다. 같은 저자는 이후 "어떻게 하면 더 많은 출판 연구를 참되게 만들 것인가"로 주제를 옮겼습니다 (PMID 25334033). 출판된 논문 중 거짓 발견이 몇 퍼센트인지 계산해 보려는 한 시도에는 정면 반박이 나왔습니다. 표집·계산·결론 세 층위 모두가 결함이라는 반박입니다 (PMID 24068251).
이 반박의 논거는 이 글의 주제와 맞닿아 있습니다. 논문 초록에 실린 p값은 심하게 왜곡된 선택 표본이라는 것입니다. 선택적 보고 말고도 없는 효과를 있다고 하게 만드는 원인은 여럿 있습니다. 특히 관찰연구에서는 재지 않은 다른 원인이 결과를 흔드는 일이 그렇습니다. 반박의 요지는 그런 계산이 이 원인들을 무시한다는 것입니다 (PMID 24068251).
반대 진영도 있습니다. 의학 허무주의를 정면으로 반박한 논문은 "대부분의 출판 연구 결과가 거짓"이라는 명제와 그 뒤의 허무주의 논의가 사실의 본성에 대한 지지 불가능한 설명 위에 서 있다고 주장합니다. 어떤 지식도 틀릴 수 있고, 지식은 여러 사람의 검증을 거치며 자리를 잡아 갑니다. 이 두 가지를 제대로 셈에 넣으면, 애초에 왜 한 편의 정량 연구가 반박 불가능하게 참일 것이라 기대하느냐는 질문이 먼저 나온다는 것입니다 (PMID 33218468).
이 저자들은 앞의 논문이 지적한 연구 체제의 결함에는 동의하고 시정을 촉구합니다. 그러면서도 허무주의가 현재 연구 상태의 자연스러운 귀결은 아니라고 결론짓습니다 (PMID 33218468).
이 절이 남기는 교훈은 하나의 p값은 하나의 표를 던진 것이라는 점입니다. 논문을 믿지 말라는 뜻은 아닙니다.
정직한 미해결
① 문턱을 없앨 것인가. 이 글은 이 질문에 답하지 못합니다. 없애자는 쪽(PMID 28698825, PMID 41748420)과 남기자는 쪽(PMID 32157489)의 논거를 앞에서 나란히 놓았습니다. 그 사이에는 축을 더하자는 제안(PMID 41480455)과 결정 규칙을 다시 짜자는 제안(PMID 30222466)이 있습니다. 어느 쪽도 아직 이기지 않았습니다.
② 새 도구도 오해됩니다. 취약성 지수가 그 실례입니다. 사람이 감각할 수 있는 단위로 번역하려고 만든 지표가, 추적 소실 인원과 견주는 부적절한 비교로 퍼졌습니다. 그래서 "이 비교를 하지 말라"는 방법론 논문 두 편이 나왔습니다 (PMID 42605132, PMID 38777001). 도구를 바꾼다고 해결되는 문제가 아닐 수 있다는 뜻입니다. 지금 손에 있는 것은 판정이 아니라 보조 눈금뿐입니다.
더 깊이 가려면
논문에서 "유의한 차이가 있었다"를 만났을 때 물어볼 것은 세 가지입니다.
- 정확한 p값과 효과의 크기가 적혀 있나. "p<0.05"만 적힌 것과 "p=0.048"이 적힌 것은 다릅니다 (PMID 32157489). 효과가 얼마나 큰지와 그 그럴듯한 범위는 p값만으로 알 수 없습니다 (PMID 41748420, PMID 28698825).
- 사건이 몇 건이었나. 취약성 지수가 없어도 사건 수와 표본 크기는 대개 적혀 있고, 사건이 적으면 결론이 얇습니다 (PMID 24508144, PMID 35820586). 다만 그 값을 추적 소실 인원과 1:1로 비교하는 것은 부적절하다는 지적이 있습니다 (PMID 38777001, PMID 42605132).
- 한 편인가, 여러 편인가. 하나의 p값은 하나의 표입니다. 여러 편을 묶어서 보는 방법이 따로 있습니다. 그 연구가 무엇을 어떻게 볼지 미리 적어 두었는지(사전등록)도 함께 보면 됩니다.
하나만 남긴다면 — 0.05는 자연이 정한 선이 아니라 사람들이 합의한 선입니다. 그 선을 넘었다는 사실은 그 결과가 몇 건의 사건 위에 서 있는지와 함께 읽어야 뜻이 통합니다. 취약성 지수는 그 "몇 건"을 세는 한 방법일 뿐 판정은 아닙니다.
근거 논문
0.05라는 문턱과 그 논쟁
- "Goodbye P<0.05." (2026) — PMID 41748420 — 단평 리뷰. 버리자는 대상은 p값이 아니라 문턱과 "통계적 유의성"이라는 용어이고, 대안 목록에 "더 엄격한 문턱"도 있습니다.
- "The earth is flat (p > 0.05)." (2017) — PMID 28698825 — 리뷰·논증. 문턱 제거에 대한 반대 논거 3종을 저자들이 직접 열거하며, 최종 결론은 어떤 추론 방법을 쓰든 이분법적 문턱 사고가 사람의 판단에 자리를 내줘야 한다는 것.
- "Statistical significance: p value, 0.05 threshold… reasons for a conservative approach." (2020) — PMID 32157489 — 문턱 유지론 개관. 대안은 문턱 조정이 아니라 2차 근거·데이터 공유·비용효과 분석. 실제 p값을 적으라고 요구.
- "Bayesian Design of Proof-of-Concept Trials." (2015) — PMID 30222466 — 방법론 논문(낭포성 섬유증·건선 2건에 적용). 베이즈 틀로 GO/NO-GO 기준을 다시 짭니다.
취약성 지수의 원형·적용 범위·분야별 측정
- "…a case for a Fragility Index." (2014) — PMID 24508144 — 방법론 원저. 대상은 초록에 유의한 이분형·생존 결과를 하나 이상 보고한 고영향 저널 무작위시험 399편. 결론은 "P값을 보완한다".
- "Statistical robustness … has improved but was low across medical specialties." (2022) — PMID 35820586 — 2,544편에서 유의한 이분형 우월성 결과를 보고한 643편만 계산. 우산 리뷰는 15개 진료과 문헌고찰 57편.
- "Fragility Index in Cardiovascular RCTs." (2019) — PMID 31822121 — 표본 500명 초과 123편. 있음/없음으로 세는 결과에만 쓸 수 있다고 명시.
- "…RCTs supporting clinical practice guidelines for acute coronary syndrome." (2023) — PMID 36882068 — 계산 조건(두 군·1:1 배정·이분형 결과·P<0.05)을 갖춘 132편. 지침을 떠받치는 시험의 견고성 평가에 유용할 수 있다는 결론.
- "Fragility Index in RCTs of Ischemic Stroke." (2019) — PMID 30765294 — 25편. 결론은 이 분야의 많은 시험이 다른 분야에 비해 괜찮은 수준의 견고성을 가진다는 것.
- "Statistical fragility of RCTs in shoulder arthroplasty." (2021) — PMID 33271323 — 13편. 결과 단위 집계, 결과의 74.4%가 지수 < 추적 소실·89.7%가 애초에 비유의. 결론은 비슷한 수준의 견고성. 단위가 달라 표에서 뺐습니다.
- "The Fragility Index of RCTs for Preterm Neonates." (2022) — PMID 35615631 — 66편. 지수와 p값의 상관 −0.857.
- "Predictors of Increased Fragility Index Scores…: An Umbrella Review." (2023) — PMID 36719446 — 리뷰 50편이 보고한 1,007편. "제한된 표본에 근거한" 값임을 명시하고 설계 개선을 촉구.
- "…for Patent Foramen Ovale Closure in Cryptogenic Stroke." (2019) — PMID 30890394 — 6편. 결론은 긍정적 결과를 신중히 해석하고 개별화된 의사결정을 하라는 것.
반대 방향 — "차이 없음"의 취약성
- "Reverse Fragility Index in Plastic Surgery RCTs." (2025) — PMID 39850534 — 비유의 결과 40편·65개 1차 결과. 결론은 이 지표가 P값을 보완한다는 것.
- "Statistical Fragility of Steroid-Antiviral Therapy for Bell's Palsy." (2025) — PMID 40741786 — 11편·결과 57개. 결론은 근거가 엇갈리며 특히 유의한 쪽이 취약하다는 것.
취약성 지수를 겨눈 비판
- "…A Simulation Analysis of 300,000 Randomized Controlled Trials." (2026) — PMID 42605132 — 모의 시험 30만 건. 결론은 취약성 지표가 견고성의 독립적 척도가 아니며 추적 소실과의 직접 비교가 부적절하다는 것.
- "The Number of Patients Lost to Follow-Up May Exceed the Fragility Index…" (2025) — PMID 38777001 — 문헌 감사 39편 + 가상 시험 모형. 결론은 이전에 묘사된 만큼 취약하지 않을 수 있다는 것, 다만 개별 시험의 값어치는 맥락·편향·결과를 함께 보는 총체적 접근으로만 판단된다는 것.
견고한 쪽의 측정과 사용법 제안
- "…RCTs of Spinal Cord Stimulation for Pain…" (2026) — PMID 41376548 — 30편, 결론은 대다수가 견고하다는 것.
- "Robustness of RCT evidence for SGLT2 inhibitors in heart failure with preserved and mildly reduced ejection fraction." (2026) — PMID 41314931 — EMPEROR-Preserved·DELIVER(박출률 40% 이상). 배경에 이 약이 모든 심부전 아형에서 심혈관 사망과 심부전 입원을 줄인다고 적고, 이 두 아형에서만 절대 이득·견고성이 크지 않다고 봅니다. 위험비 0.79·0.82, 필요치료수 30·32.
- "Significance, Fragility, and Robustness in Clinical Trials." (2025) — PMID 41480455 — 129편 + 모의 시험 72만 건. 저자 한정어: 증거 등급을 나눌 뿐 참·인과·재현을 증명하지 않고, 모의 시험에 출판 편향·선택적 보고를 넣지 않았으며, 다른 자료형으로의 확장은 검증되지 않았습니다.
한 편의 유의한 결과를 어떻게 읽을 것인가
- "Why most published research findings are false." (2005) — PMID 16060722 — 에세이. 대부분의 설계와 상황에서 연구 주장이 참이기보다 거짓일 가능성이 크다는 결론.
- "How to make more published research true." (2014) — PMID 25334033 — 같은 저자의 후속 글("어떻게 개선할 것인가").
- "Discussion: Why 'An estimate of the science-wise false discovery rate…' is false." (2014) — PMID 24068251 — 논평. 위발견율 추정 시도를 표집·계산·결론 세 층위에서 비판. (저자가 누구인지는 초록에 없습니다.)
- "Countering medical nihilism by reconnecting facts and values." (2020) — PMID 33218468 — 논증. 연구 체제의 결함에는 동의하고 시정을 촉구하되, 허무주의가 자연스러운 귀결은 아니라고 결론.