
Paperis 아티클
p=0.03은 무엇의 확률인가 — p값이 답하는 하나의 질문
p값은 효과가 전혀 없다면 이런 결과가 얼마나 드문지를 묻는 질문 하나에 답합니다. 그 답이 실제 논문에서 표본의 크기, 비교의 횟수, 분석하는 사람의 선택에 따라 어떻게 움직이는지를 봅니다.
p=0.03은 무엇의 확률인가 — p값이 답하는 하나의 질문
이야기는 급성 허혈성 뇌졸중 환자에게 아스피린을 준 국제 시험 하나에서 시작합니다. 36개 나라 467개 병원이 환자 19,435명을 모았고, 누가 아스피린을 받을지는 제비뽑기로 정했습니다. 6개월 뒤 숨졌거나 남의 도움 없이 지내지 못하게 된 사람은 아스피린을 받은 쪽이 62.2%, 받지 않은 쪽이 63.5%였습니다. 1,000명당 13명의 차이입니다.
이 차이가 우연인지 가늠하려고 확률을 하나 계산합니다. 아스피린에 효과가 전혀 없다고 할 때, 이만한 차이나 그보다 더 벌어진 차이가 나올 확률입니다. 이 확률이 p값입니다. 이 시험에서는 0.07로 계산됐습니다.
계산은 한 번 더 있었습니다. 환자들은 시험에 들어올 때부터 예후, 곧 앞으로의 경과를 내다본 전망이 저마다 달랐습니다. 이 출발선의 차이를 계산에 반영해 맞추는 것을 보정이라고 합니다. 예후를 보정하자 차이는 1,000명당 14명, p값은 0.03이 됐습니다 (PMID 9174558). 초록에는 이 값이 2p로 적혀 있는데, 차이가 어느 방향으로 벌어졌든 다 따진 값이라는 표시입니다.
차이는 1,000명당 13명에서 14명으로 거의 그대로입니다. 그런데 p값은 0.05 선의 이쪽에서 저쪽으로 건너갔습니다. 논문들이 흔히 「통계적으로 유의하다」를 가르는 기준선입니다. 1,000명당 14명이라는 작은 차이가 선을 넘은 데에는 19,435명이라는 많은 인원이 있습니다. 이 시험 하나에 p값을 움직이는 것 두 가지가 함께 들어 있습니다. 하나는 몇 명을 봤느냐는 표본의 크기이고, 다른 하나는 보정을 할지 말지 같은 분석하는 사람의 선택입니다. 이 글은 여기에 비교를 여러 번 하는 일을 셋째로 더해, 이 셋이 실제 논문에서 p값을 어떻게 움직이는지를 봅니다.

⚠️ 아래 나오는 약과 시험의 이름은 전부 숫자를 읽는 법을 보이기 위한 사례입니다. 어떤 치료를 쓸지 말지에 대한 판단이 아니고, 각 숫자는 그 연구의 설계와 대상 안에서만 뜻을 갖습니다.
먼저 되짚을 네 가지 말
「「통계적으로 유의했다」는 무엇을 말하나 — 동전 던지기로 읽는 p값」(아래에서는 첫걸음 편)이 동전 하나로 세운 말 네 개를 여기 다시 적어 둡니다.
귀무가설은 「효과가 전혀 없다」는 가정입니다. p값은 귀무가설이 참이라고 할 때 관측된 값 또는 그보다 더 벌어진 값이 나올 확률입니다. 뇌졸중 시험에서 계산한 확률이 바로 이것입니다. 어느 선 아래면 「우연으로 보기 어렵다」고 부를지를 미리 정해 두는데, 그 선이 유의수준입니다. 가장 흔한 선은 0.05이고, p값이 이 선 아래로 내려가면 「통계적으로 유의하다」고 부릅니다.
효과크기는 차이가 얼마나 큰지를 재는 값입니다. 뇌졸중 시험에서는 두 쪽의 비율 차이가 효과크기입니다. p값이 「얼마나 드문가」를 말한다면, 효과크기는 「얼마나 큰가」를 말합니다. 끝으로 「유의하지 않다」는 「이 데이터로는 효과가 없다는 가정을 밀어내지 못했다」까지만 말합니다.
첫걸음 편은 동전을 10,000번 던지면 앞면이 51.5%만 나와도 선을 넘는다는 것을 셈으로 보였습니다. 절반에서 아주 조금 치우쳤을 뿐인데도, 던진 횟수가 많으면 그 작은 치우침이 「유의」해집니다. 이 글은 같은 일이 실제 논문에서 어떻게 일어나는지를 봅니다.
사람이 많으면 작은 차이도 선을 넘습니다
뇌졸중 시험의 저자들은 아스피린이 6개월 시점에 작지만 가치 있는 개선을 낸다고 해석했습니다. 비슷한 규모의 중국 시험과 함께 놓으면, 아스피린이 처음 몇 주 동안 1,000명당 약 10건의 사망이나 뇌졸중 재발을 작지만 실제로 줄인다고 적었습니다. 두 시험 모두 허혈성 뇌졸중이 시작된 뒤 가능한 한 일찍 아스피린을 시작하는 쪽을 시사한다고도 적었습니다. 저용량 아스피린을 이어 가면 더 긴 기간 보호가 된다는 것은 앞선 시험들이 보였다고 덧붙였습니다. 이 해석은 1997년의 것입니다. 이 시험은 허혈성 뇌졸중으로 의심된 환자만 받았고, 이 글은 이 해석을 처방 판단으로 옮기지 않습니다. 해도 같은 단위로 적혀 있습니다. 아스피린을 받은 쪽에는 수혈이 필요했거나 목숨을 잃은 머리 바깥 출혈이 1,000명당 5건 더 있었습니다. 헤파린을 함께 받지 않은 사람들에서는 그 차이가 2건이었고 유의하지 않았습니다 (PMID 9174558).
1,000명당 14명은 저자들의 말대로 작은 차이입니다. 이 작은 차이가 선을 넘을 수 있었던 데에는 사람이 많았다는 사정이 있습니다. 사람이 많아질수록 우연에 따른 들쭉날쭉함이 작아지고, 그만큼 작은 차이도 「우연치고는 드물다」는 판정을 받습니다. 이 시험은 그 판정과 함께 1,000명당 몇 명이라는 크기를 적었습니다. 그래서 독자가 「작지만 가치 있다」는 해석을 직접 따져 볼 수 있습니다.
크기를 적지 않으면 무슨 일이 생기는지는 극단적인 예에서 잘 보입니다. 인공관절 수술 기록 95만여 건에서, 의학적 이유 없이 짝지은 변수 20쌍 가운데 14쌍이 선을 넘었습니다. 그중 한 쌍은 수술 코드 번호와 혈당 지표였고, 둘이 함께 움직이는 정도를 잰 값은 −0.0435였습니다. 이 값은 0이면 전혀 함께 움직이지 않고 1이나 −1이면 완전히 함께 움직이는 눈금이라, −0.0435는 0에 아주 가깝습니다. 두 변수 사이에 의미 있는 관계가 없다는 뜻입니다. 그런데 p값은 2.14×10⁻⁴⁰, 소수점 아래 마흔 번째 자리에 가서야 숫자가 나타나는 값이었습니다. 저자들은 이 결과들이 임상적 의미 없이 오로지 표본 크기가 만든 것이라고 결론짓습니다. 그리고 큰 데이터베이스 연구에서 유의성을 과하게 해석할 위험을 지적하며, 가설을 먼저 세우는 방법과 효과크기의 해석이 필요하다고 적습니다 (PMID 40885217).
무작위 시험들을 모아 봐도 같은 일이 보입니다. 연구자는 시험을 시작하기 전에 기대하는 효과크기를 정하고, 그 크기를 잡아낼 수 있도록 사람 수를 정합니다. 말초신경차단(신경 주변에 마취제를 놓아 그 신경이 맡은 부위의 통증을 막는 방법)에 보조제를 더하는 무작위 시험 59편 가운데 45편(76%)이 주된 결과에서 유의한 결과를 보고했습니다. 그런데 그 가운데 22%는 처음에 기대했던 효과크기에 이르지 못했습니다. 표본 수 계산을 제대로 보고한 시험은 78%였습니다. 저자들은 이 결과 지표와 기대 효과크기를 앞으로의 시험에서 써서 방법을 더 고르게 만들자고 결론짓습니다 (PMID 38978187). 같은 숫자에서 이 글이 읽는 것은 하나입니다. 연구자가 기대했던 크기에 못 미친 차이도 유의하다는 판정을 받을 수 있습니다. 그 차이가 임상적으로 작았는지, 왜 기대에 못 미쳤는지는 초록에 없습니다.
사람이 많은 연구에서 작은 p값은 큰 차이를 뜻하지 않습니다. 크기는 효과크기가 따로 말합니다.
사람이 적으면 「유의하지 않음」이 「효과 없음」을 뜻하지 않습니다
표본의 크기는 반대 방향으로도 p값을 움직입니다. 사람이 적으면 들쭉날쭉함이 커서, 실제로 차이가 있어도 p값이 선 아래로 내려오기 어렵습니다. 청소년 남자 축구선수 35명의 예가 있습니다. 17명은 사흘 동안 해가 떠 있는 시간에 먹지도 마시지도 않았고, 18명은 평소대로 지냈습니다. 기억력·주의력·각성 반응의 어느 항목에서도 두 쪽의 변화에 유의한 차이가 나오지 않았습니다.
저자들은 이것을 이 조건에서 인지 저하가 유의하게 검출되지 않았다는 예비적이고 가설을 만드는 수준의 근거로 정리합니다. 이 연구는 두 쪽의 차이가 의미 있는 크기보다 작다는 것을 보이도록 설계되지 않았습니다. 그래서 목표로 삼은 중간 크기보다 작은 효과는 배제할 수 없다고 적습니다. 결론은 유의한 차이가 없다는 것만으로는 단식과 운동 훈련이 함께 가도 된다고 추론할 수 없다는 것입니다 (PMID 42588098). 「차이를 못 찾았다」에서 「차이가 없음을 보였다」로 가려면, 처음부터 그것을 보이도록 설계해야 합니다.
같은 문제는 약의 승인에서도 걸렸습니다. 코로나19 치료제 렘데시비르의 초기 승인은 주로 두 시험에 기댔습니다. 세 번째 시험은 효과를 가려낼 만큼 크지 않아 결론을 내릴 수 없다고 판정됐습니다. 통상의 계산으로는 이 시험의 「유의하지 않음」이 사람이 모자라서인지 효과가 없어서인지 가리기 어렵습니다. 베이즈 가설검정은 효과가 없다는 쪽의 증거도 셀 수 있는 다른 계산법입니다. 한 연구팀이 2021년에 이 계산법으로 세 시험을 다시 분석했습니다. 주된 결과인 임상적 호전에서는 증거가 어느 쪽으로도 모호했습니다. 부차적 결과인 사망률 감소에서는 효과가 없다는 쪽으로 중간 정도의 증거가 나왔습니다. 승인 뒤 발표된 세 연구의 추가 분석도 같은 쪽이었습니다. 저자들은 규제기관이 가용한 근거 전체를 놓고 판단하라고 권합니다. 결과가 유의하지 않을 때 이 계산법이 특히 쓸모 있고, 임상 효능 자료가 적을 때 이 일이 더 급하다고도 적습니다 (PMID 34297766).
사람이 적었다는 사정을 결과가 나온 뒤에 핑계로 쓰는 관행도 있습니다. 효과를 찾지 못하고 끝난 연구에서 「이 연구가 효과를 잡아낼 힘이 얼마였나」를 거꾸로 계산해, 「환자가 너무 적어서 이로움을 찾지 못했다」고 설명하는 방식입니다. 한 골수이식 학술지의 통계 연재에 붙은 편집자 소개글은 이것을 가장 심한 오용으로 꼽습니다. 귀무가설을 기각할 힘은 이미 p값 계산 안에 들어 있으니, 결과가 나온 뒤 계산한 힘으로 음성 결과를 해석해서는 안 된다는 것입니다. 이 자리의 근거는 편집 논평 한 편입니다 (PMID 36869191).
사람이 적은 연구의 「유의하지 않음」은 「효과가 없다」와 「사람이 모자랐다」를 가르지 못합니다. 둘을 가르는 데 다가가는 길은 두 가지입니다. 하나는 차이가 의미 있는 크기보다 작다는 것을 보이도록 처음부터 설계하는 방법이고, 다른 하나는 효과가 없다는 쪽의 증거도 세는 계산법입니다.
다만 이런 방법들을 정리한 한 논문은, 어떤 통계적 접근으로도 귀무가설이 참이라는 것을 증명할 수는 없다고 적습니다. 그러면서도 이런 도구들이 쓰기 쉬워진 지금, 전통적인 검정을 보완하거나 넘어서 효과가 없다는 쪽에 대해 더 많은 것을 말할 때가 됐다고 결론짓습니다 (PMID 30873486).
비교를 여러 번 하면 드문 일도 흔해집니다
앞의 축구선수 연구는 같은 설문으로 네 항목을 함께 물었고, 그중 하나가 스스로 느끼는 수면의 질이었습니다. 수면의 질에서 두 쪽의 변화 차이를 잰 p값은 0.029로, 0.05 선을 넘었습니다. 그런데 이 연구는 네 항목을 함께 비교했기 때문에, 선을 0.05의 4분의 1인 0.0125로 엄하게 잡았습니다. 네 번 비교하니 선을 넷으로 나눈 것입니다. 0.029는 이 엄한 선을 넘지 못했습니다. 저자들은 이 결과를 새 가설을 만드는 용도로만 해석하고 반복 연구로 확인돼야 한다고 적습니다. 이 차이는 평소대로 지낸 쪽의 수면이 나빠진 것과, 단식한 쪽이 유의하지 않게 조금 나아진 것이 겹친 결과였습니다 (PMID 42588098).

한 번의 연구에서 검정을 여러 번 하는 것을 다중비교라고 합니다. 결과 지표를 다섯 개 재고, 참가자를 세 무리로 나누고, 시점을 네 번 잡으면 검정은 금세 수십 개가 됩니다. 효과가 전혀 없어도 그중 몇 개는 선을 넘을 수 있습니다. 공정한 동전 20개를 10번씩 던지면 적어도 하나가 선을 넘을 확률은 약 35%입니다(첫걸음 편의 셈입니다).
0.05가 얼마나 드문 일인지를 감각으로 바꾸는 장치도 있습니다. p값을 −log₂(p)로 바꾼 값을 S값이라고 부릅니다. 이 값은 전체를 몇 번 반으로 접어야 p만큼 작아지는지를 센 수입니다. 공정한 동전 던지기 같은 단순한 실험에 견주어 직관을 맞추려고 제안됐습니다 (PMID 32998683, PMID 37637018). S값이 s라면, 공정한 동전을 s번 연달아 던져 모두 앞면이 나온 만큼 놀랍다는 뜻으로 읽습니다. p=0.05의 S값은 약 4.3이라, 공정한 동전을 네 번 남짓 던져 모두 앞면이 나온 정도의 놀라움입니다.
그런데 이 놀라움은 한 번만 볼 때의 이야기입니다. 동전을 스무 번 던지는 동안 어딘가에서 네 번 연달아 앞면이 나올 확률은 절반 가까이 됩니다. 4.3과 「절반 가까이」는 이 글이 산수로 옮긴 값입니다. 스무 번 던진 기록에는 네 번 연속이 들어설 자리가 서로 겹치며 열일곱 곳 있고, 그 자리를 한꺼번에 살피는 일이라 앞의 동전 20개와는 다른 계산입니다. 비교에 옮기면, 서로 영향을 주지 않는 비교 20번을 각각 0.05 선으로 하면 적어도 하나가 선을 넘을 확률은 약 64%입니다(이것도 이 글의 산수입니다). 한 번만 보면 드문 일도 여러 번 보면 흔해집니다.

지도를 작은 칸으로 나눠 칸마다 시간에 따른 추세를 검정하면 검정이 수천 번이 됩니다. 그 전부를 셈에 넣어 조정하지 않으면 헛발견이 알 수 없는 방식으로 늘어납니다. 어떤 결과가 유의하다는 판정의 실체는, 함께 검정했지만 유의하지 않았던 결과가 몇 개였고 그 값이 얼마였는지에도 달려 있습니다. 여러 번 비교하는 맥락에서는 전체 이야기를 알기 전에는 무엇이 유의한지 옳게 정할 수 없습니다. 이 진단은 저자들 스스로 선별적이고 망라적이지 않은 개관이라고 부른 논의 논문에서 나왔습니다 (PMID 39637466). 보건 전문직 교육 연구자를 위한 한 안내 논문도, 비교의 수를 제대로 고려하지 않으면 「p<0.05」 기준이 결과를 오도할 수 있다고 적습니다 (PMID 38680196).
논문에 적힌 p값 하나를 읽으려면 그 뒤에 비교가 몇 번 있었는지를 함께 알아야 합니다.
분석하는 사람의 선택도 p값을 움직입니다
뇌졸중 시험으로 돌아가겠습니다. 보정하지 않은 계산과 예후를 보정한 계산은 같은 자료에서 나왔고, 초록에 나란히 적혀 있습니다. 시험에 들어올 때의 예후를 보정하는 것은 흔히 쓰이는 분석입니다. 그런데도 보정을 할지 말지라는 선택 하나로 p값이 선을 건넜습니다. 이 시험은 두 값을 모두 적었기 때문에 독자가 그 움직임을 볼 수 있습니다.
모든 선택이 이렇게 드러나지는 않습니다. 같은 자료라도 분석하는 길은 여럿입니다. 튀는 값을 뺄지 넣을지, 어느 변수를 계산에 넣을지, 자료 수집을 언제 멈출지를 정해야 합니다. 같은 자료를 분석하는 길에서 연구자가 고를 수 있는 선택의 폭을 연구자 자유도라고 합니다. 결과를 보면서 길을 고르면 길마다 검정을 한 번씩 한 것과 같아지는데, 논문에는 마지막에 고른 하나만 적힙니다. 어느 변수를 넣을지 정하는 일, 곧 모형을 고르는 과정에서도 잘 알려지지 않은 형태의 다중검정이 생깁니다. 간호 연구자를 위한 한 교육 논문은 이 점을 들면서, 연구자 자유도의 남용이 그 분야에서 거의 주목받지 못했다고 적습니다. 같은 논문은 이런 한계에도 가설검정의 틀이 관측된 효과를 우연으로 설명할 가능성을 배제하는 데 도움이 되고, 앞으로도 주된 도구로 남으리라고 결론짓습니다 (PMID 31349121).
어떤 결과를 보고할지도 선택입니다. 유의한 결과만 골라 보고하는 선택은 논문 여러 편을 모아 봐야 드러납니다. 일본의 두 대형 심리학회 학술대회에 나온 사회심리학 발표문을 모은 분석이 그런 예입니다. 학술대회 발표문은 사실상 동료 심사를 거치지 않습니다. 그래서 편집자나 심사자의 압력이 없어도 연구자들이 유의한 결과만 골라 보고하는지를 시험할 수 있었습니다. 2013년 발표문에서 유의한 결과의 비율은 76%였습니다. 그런데 그 연구들이 지닌 힘, 곧 효과를 잡아낼 가능성으로 보아 기대되는 비율은 7%였습니다. 저자들은 이 간극을 선택적 보고가 있었다는 신호로 읽었습니다.
다만 발표문들에 증거가 전혀 없지는 않았습니다. 같은 연구를 그대로 다시 했을 때 다시 유의하게 나오리라 기대되는 비율, 곧 기대 재현율은 31%였습니다. 효과가 전혀 없을 때 기대되는 5%보다 유의하게 높은 값입니다. 2018년에는 기대 재현율이 44%로 올랐습니다. 유의하다고 보고된 결과 가운데 실제로는 효과가 없는 잘못된 발견이 차지할 수 있는 최대 추정 비율은 68%에서 35%로 내려갔습니다. 그래도 저자들은 이 값 역시 보고된 결과의 상당 부분이 거짓 양성이었음을 시사한다고 봤습니다. 저자들의 결론은 선택적 보고가 있었지만 분야 전체가 헛발견으로 덮인 것은 아니라는 것입니다. 조금 나아진 조짐이 있으나, 2018년에도 증거의 가치는 약해서 낙관할 수 없다고 덧붙입니다 (PMID 38250729).
선택은 결과를 글로 옮기는 자리에서도 일어납니다. 한 신경생리학 저널이 2019~2020년에 실은 논문 580편을 점검해 보니, 40%는 자기 검정의 유의수준을 정의하지 않았습니다. p값이 0.05와 0.1 사이인 논문의 64%는 그것을 「통계적 경향」으로 잘못 해석했습니다. 선을 넘지 못한 값을 「경향」이라는 이름으로 읽은 것입니다. 이 저널은 2016년 점검에서 부실한 보고를 공개적으로 지적받고 저자 안내를 고친 뒤였습니다. 저자들은 공개 지적이 보고를 개선하는 데 별 효과가 없었고, 보고 관행을 요구하거나 강하게 권하는 것도 일부만 효과가 있었다고 정리합니다. 점검은 한 저널에 한정됐지만 고립된 사례는 아닐 것이라 보고, 더 강한 대책이 필요하다고 결론짓습니다 (PMID 38434651).
분석하는 사람의 선택은 p값을 움직이고, 그 선택이 글에 다 적혀 있을 때에만 독자가 그 움직임을 볼 수 있습니다.
논문에서 p값을 만났을 때 물을 세 가지
세 가지를 함께 놓으면 초록의 「p=0.03」 앞에서 물을 것이 정해집니다.
첫째는 몇 명을 봤느냐입니다. 사람이 아주 많다면 그 p값 옆에 1,000명당 몇 명 같은 크기가 적혀 있는지를 봅니다. 사람이 적고 결과가 유의하지 않다면, 그 연구가 차이가 의미 있는 크기보다 작다는 것을 보이도록 설계됐는지를 봅니다.
둘째는 비교를 몇 번 했느냐입니다. 지표·무리·시점을 몇 개 봤는지, 그 수만큼 선을 조정했는지를 봅니다. 축구선수 연구처럼 조정 전과 조정 후를 함께 적은 논문은 이 질문에 스스로 답합니다.
셋째는 분석이 미리 정해져 있었느냐입니다. 미리 정한 분석이 무엇이었는지 적혀 있는지, 뇌졸중 시험처럼 여러 계산을 나란히 적었는지, 결론이 다른 분석에서도 버티는지를 봅니다. 앞의 안내 논문도 효과크기, 추정이 얼마나 흔들릴 수 있는지를 적는 범위인 신뢰구간, 귀무가설을 함께 보고하고, 분석을 달리해도 결과가 버티는지 확인하라고 권합니다 (PMID 38680196).
p값은 효과가 전혀 없다면 이런 결과가 얼마나 드문지를 묻는 질문 하나에 답하고, 그 답은 표본의 크기, 비교의 횟수, 분석하는 사람의 선택에 따라 움직입니다.
0.05라는 선이 어디서 왔는지, 그리고 유의한 결과가 실제로 몇 명의 사건에 달려 있는지를 세는 법은 「0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법」이 이어서 봅니다. 크기 옆에 붙는 범위를 읽는 법은 「한 번 센 숫자는 얼마나 흔들리나 — 괄호 안 두 숫자, 신뢰구간」에서 다뤘고, 그 범위가 흔히 어떻게 오해되는지는 「신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법」이 이어서 봅니다.
근거 논문
- "The International Stroke Trial (IST): a randomised trial of aspirin, subcutaneous heparin, both, or neither among 19435 patients with acute ischaemic stroke." (1997) — PMID 9174558 — 19,435명. 아스피린 6개월 사망·의존 62.2% 대 63.5%(1,000명당 13명, 2p=0.07), 기저 예후 보정 뒤 1,000명당 14명(2p=0.03). 저자 해석은 작지만 가치 있는 개선. 아스피린 쪽 수혈·치명 두개외 출혈 1,000명당 5건 초과(헤파린 없이는 2건, 비유의).
- "Fully Randomized Predictor-Outcome Pairings Using a National Database Yield Frequent Statistical Significance Without Clinical Meaning." (2025) — PMID 40885217 — 인공관절 955,092건, 난수로 짝지은 20쌍 중 14쌍 p<0.05. 수술 코드 대 당화혈색소 r=−0.0435, P=2.14×10⁻⁴⁰. 저자 결론은 표본 크기가 만든 유의성, 가설 주도 방법과 효과크기 해석 필요.
- "Primary outcomes and anticipated effect sizes in randomised clinical trials assessing adjuncts to peripheral nerve blocks: A scoping review." (2024) — PMID 38978187 — 59편 중 45편(76%) 주된 결과 유의, 그중 22%는 기대 효과크기 미달. 표본 수 계산 적절 보고 78%. 저자 결론은 방법론 동질성 제고.
- "Effects of Three Consecutive Days of Diurnal Intermittent Fasting on Cognitive Function, Psychomotor Vigilance, and Sleep Quality in Adolescent Male Soccer Players." (2026) — PMID 42588098 — 35명(17 대 18). 인지 항목 유의한 차이 없음, 동등성·비열등성 설계가 아니라 중간 크기보다 작은 효과 배제 불가. 수면의 질 p=0.029는 네 항목 보정 문턱 0.0125를 못 넘어 가설생성용.
- "Rethinking remdesivir for COVID-19: A Bayesian reanalysis of trial findings." (2021) — PMID 34297766 — 결론 불가였던 세 번째 시험의 비유의는 통상 틀에서 검정력 부족과 효과 부재를 가리기 어렵다. 재분석에서 임상적 호전은 모호, 사망률 감소는 효과 부재 쪽 중간 정도 증거. 규제기관은 근거 전체를 보라는 권고.
- "Making 'null effects' informative: statistical techniques and inferential frameworks." (2018) — PMID 30873486 — 동등성 검정·베이즈 추정·베이즈 인자로 귀무 결과를 평가하는 법. 어떤 통계적 접근도 귀무가설이 참임을 증명할 수 없다. 도구가 쉬워져 전통적 검정을 보완하거나 넘어설 때가 됐다는 결론.
- "Inappropriate use of statistical power." (2023) — PMID 36869191 — 학술지 통계 연재의 편집자 소개글(원저 연구 아님). 음성 결과 뒤 관측 검정력 계산을 가장 심한 오용으로 꼽고, 검정력은 이미 p값 계산에 들어 있다고 적는다.
- "Semantic and cognitive tools to aid statistical science: replace confidence and significance by compatibility and surprise." (2020) — PMID 32998683 — S값 = −log₂(p). 동전 던지기 같은 단순한 실험에 견주어 직관을 맞추는 장치.
- "P-value, compatibility, and S-value." (2022) — PMID 37637018 — p값을 데이터와 모형 사이의 양립성 지표로 읽고, S값으로 그 양립성을 동전 던지기에 견주어 가늠하자는 제안.
- "The ghost of selective inference in spatiotemporal trend analysis." (2025) — PMID 39637466 — 논의 논문(선별적·비망라적 개관). 칸마다의 추세 검정은 수천 번의 다중검정이 되고, 다중성 맥락에서는 전체 이야기를 알기 전에는 무엇이 유의한지 정할 수 없다.
- "How to Use and Report on p-values." (2024) — PMID 38680196 — p<0.05 기준은 실질적 중요성·비교의 수·검정의 적합성을 고려하지 않으면 오도할 수 있다. 효과크기·신뢰구간·귀무가설 보고와 민감도 분석을 권한다.
- "Pervasive errors in hypothesis testing: Toward better statistical practice in nursing research." (2019) — PMID 31349121 — 교육 논문. 모형 선택에서 생기는 다중검정, 연구자 자유도 남용. 한계에도 가설검정 틀은 우연 배제에 도움이 되고 주된 도구로 남으리라는 결론.
- "A systematic review of conference papers presented at two large Japanese psychology conferences in 2013 and 2018." (2024) — PMID 38250729 — 심사 없는 발표문. 사회심리학 발표문. 2013년 관측 발견율 76% 대 기대 7%, 기대 재현율 31%(5%보다 유의하게 높음). 2018년 44%, 최대 거짓발견율 68%→35%. 결론은 분야 전체가 헛발견은 아니나 2018년에도 증거 가치는 약해 낙관할 수 없다.
- "Poor statistical reporting, inadequate data presentation and spin persist despite Journal awareness and updated Information for Authors." (2023) — PMID 38434651 — 한 저널 논문 580편. 40%가 유의수준 미정의, p 0.05~0.1 논문의 64%가 「경향」으로 잘못 해석. 공개 지적은 개선에 별 효과가 없었고, 고립된 사례가 아닐 것이라며 더 강한 대책을 요구.