Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

「통계적으로 유의했다」는 무엇을 말하나 — 동전 던지기로 읽는 p값

p값은 「효과가 전혀 없다면, 이만한 차이가 우연히 얼마나 자주 나오나」 하나에만 답합니다. 차이가 얼마나 큰지는 말하지 않고, 0.05는 사람이 정한 관례이며, 「유의하지 않다」는 「효과가 없다」와 같은 말이 아닙니다

🌱첫걸음✦AI 생성기초과학 · 2026년 9월 28일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

「통계적으로 유의했다」는 무엇을 말하나 — 동전 던지기로 읽는 p값

「통계적으로 유의한 효과」라는 제목

「새 치료법, 통계적으로 유의한 효과 확인」. 기사 제목이나 논문 소개 글에서 이런 문장을 한 번쯤 보셨을 것입니다. 「유의하다」는 말은 효과가 크다거나 확실하다는 뜻처럼 들립니다.

반대쪽 제목도 흔합니다. 「○○, 통계적으로 유의한 차이 없어」. 이 문장은 「효과가 없다」로 들립니다.

두 제목은 모두 숫자 하나에서 나옵니다. 논문 초록에 「p=0.03」이나 「p<0.05」처럼 적히는 숫자입니다. 이 글은 그 숫자가 답하는 질문이 무엇인지, 그리고 답하지 않는 질문이 무엇인지를 다룹니다.

설명에는 동전 하나를 씁니다. 친구가 동전을 건네며 말합니다. 「이거 한쪽으로 잘 나오는 것 같아.」 10번 던져 보니 앞면이 9번 나왔습니다. 이 동전은 휜 동전일까요, 아니면 멀쩡한 동전이 어쩌다 그렇게 나온 것일까요?

이 동전 예시는 이해를 돕기 위해 만든 것이고, 글에 나오는 동전의 확률은 이 글이 직접 계산한 값입니다. 이 동전을 글 끝까지 들고 가겠습니다. 뒤에 실제 연구에 나오는 운동이나 상담은 숫자가 어떻게 읽히는지 보여 주는 예일 뿐이고, 해 보라거나 하지 말라는 판단이 아닙니다.

공정한 동전이라면

동전이 휘었는지를 곧바로 알 방법은 없습니다. 대신 반대쪽에서 물어볼 수 있습니다. 「이 동전이 앞뒤가 반반씩 나오는 공정한 동전이라면, 10번 중 9번 이상 한쪽으로 쏠리는 일이 얼마나 자주 일어날까?」

셈은 이렇습니다. 동전을 10번 던질 때 앞뒤가 나오는 순서는 모두 1,024가지이고, 공정한 동전이라면 어느 순서든 나올 확률이 같습니다. 그 가운데 앞면이 9번 이상인 순서가 11가지, 뒷면이 9번 이상인 순서도 11가지입니다. 합쳐서 22가지, 1,024가지 가운데 약 2%입니다. 공정한 동전으로 10번 던지기를 100번 되풀이하면 2번쯤은 이만큼 쏠린다는 뜻입니다.

출발점이 된 가정, 「이 동전은 공정하다」에는 이름이 있습니다. 귀무가설은 「효과가 전혀 없다」는 가정입니다. 동전으로 말하면 「이 동전은 공정하다」이고, 약으로 말하면 「약을 먹은 무리와 먹지 않은 무리 사이에 아무 차이도 없다」입니다. 연구자가 바라는 쪽의 반대편에 세워 두고, 결과를 대 보는 기준선입니다.

방금 계산한 2%에도 이름이 있습니다. p값은 귀무가설이 참이라고 할 때 관측된 값 또는 그보다 더 벌어진 값이 나올 확률입니다. 실제로 본 값과 같은 것뿐 아니라 그보다 더 벌어진 값까지 함께 셉니다 (PMID 32539165). 동전으로 옮기면 「공정한 동전이라면 9번이나 그보다 더 쏠린 결과가 나올 확률」이고, 앞에서 9번 이상을 모두 센 것은 이 때문입니다. 초록에 적히는 「p=0.03」이 바로 이 확률입니다.

카페 탁자에서 친구가 동전 하나를 건네는 삽화. 탁자 위에는 동전 10개가 한 줄로 놓여 있고, 9개는 별 무늬 앞면, 마지막 하나만 고리 무늬 뒷면이다. 친구의 동전을 10번 던져 앞면이 9번 나왔고, 공정한 동전이라면 이만큼 쏠릴 확률은 약 2%다.

p값이 작다는 것은 결과가 「효과가 전혀 없다」는 가정과 잘 어울리지 않는다는 뜻입니다. 그런데 그 계산에는 귀무가설 말고도 깔려 있는 가정들이 있습니다. 동전이라면 정직하게 던졌다는 가정입니다. 그래서 p값을 데이터가 귀무가설과 그 밑에 깔린 가정 전체와 얼마나 어울리는지를 나타내는 값으로 읽자는 제안이 있습니다 (PMID 37637018, PMID 32998683). 작은 p값은 동전이 휘었다는 신호일 수도 있고, 던지는 과정 어딘가가 어긋났다는 신호일 수도 있습니다.

p값은 한 가지 질문에만 답합니다. 효과가 전혀 없다면, 이만한 차이나 그보다 큰 차이가 우연히 얼마나 자주 나오느냐입니다.

0.05라는 선

친구의 동전이 앞면 8번이었다면 어떨까요. 같은 셈으로 8번 이상 쏠리는 순서는 112가지, 약 11%입니다. 9번이면 약 2%, 8번이면 약 11%입니다.

논문은 대개 이 값들 사이 어딘가에 선을 긋습니다. 어느 선 아래면 「우연으로 보기 어렵다」고 부를지를 미리 정해 두는데, 그 선이 유의수준입니다. 가장 흔한 선은 0.05, 곧 20번에 1번입니다. p값이 유의수준보다 작으면 「통계적으로 유의하다」고 부릅니다. 친구의 동전은 9번이면 선을 넘고, 8번이면 넘지 못합니다.

0.05는 사람이 정한 관례입니다. 한 세기 동안 거의 모든 연구 논문이 이 선을 써 왔지만, 선 자체는 임의로 정한 것입니다. 쓰는 사람들은 간단한 방법에 끌렸고, 통계학자들은 그 열기를 굳이 누를 필요를 느끼지 않았다는 것이 그 역사를 돌아본 한 짧은 종설의 설명입니다 (PMID 41748420).

p값은 0에서 1 사이로 이어지는 값인데, 선을 그으면 0.049와 0.051이 서로 반대편으로 갈라집니다 (PMID 28698825, PMID 32710113). 그래서 p값은 증거의 세기를 나타내는 연속된 눈금으로 읽어야 한다는 주장이 있고 (PMID 28698825), 0.05보다 작은지에 눈을 두지 말고 정확한 p값을 해석하도록 가르치자는 권고가 있습니다 (PMID 32710113). 「p<0.05」라고만 적지 말고 실제 값을 적으라는 권고도 같은 이유에서 나옵니다 (PMID 32157489).

선 근처에서는 실제로 읽는 쪽이 기웁니다. 가장 이름난 일반의학 학술지들에서 p값이 0.05 근처인 결과를 해석한 문장을 뽑아 본 조사가 있습니다. p값이 0.05를 조금 넘는 97개 문장 가운데 40개가 결과를 유의한 것처럼 적었습니다. 0.05를 조금 밑도는데 유의하지 않은 것처럼 적은 문장은 303개 가운데 4개였습니다 (PMID 34355494). 저자들은 이런 오도 문장이 0.05 위쪽에서 더 흔했다고 결론짓고, 연구자와 임상의와 편집자에게 p값의 맥락과 목적에 맞게 쓰라고 당부합니다.

이 선을 어떻게 할지는 논쟁 중입니다. 2019년에는 미국통계학회의 사무총장이 「통계적으로 유의하다」는 말을 쓰지 말자고 권했습니다 (PMID 32539165). 여러 통계학자와 연구자가 p값 자체가 아니라 0.05라는 선과 「통계적 유의성」이라는 말을 버리자고 제안합니다 (PMID 41748420). 반대쪽 목소리도 있습니다. 영상의학 분야의 한 글은, 임상 연구는 결정을 내리려면 예·아니요로 된 답이 필요하므로 지금의 0.05 선을 함부로 바꾸지 말자고 적습니다. 선을 0.005로 낮추자는 제안에 대해서는 연구 비용이 늘 수 있다고 봅니다. 이 글도 「p<0.05」라고만 적지 말고 실제 값을 적으라고 권합니다 (PMID 32157489).

선에는 한 가지 성질이 더 있습니다. 0.05는 효과가 전혀 없을 때 선을 넘는 결과가 나오는 비율을 많아야 20번에 1번으로 묶어 두려고 정한 값입니다. 10번 던지는 동전에서는 그보다 조금 드물어서, 공정한 동전이 선을 넘는 경우(한쪽 9번 이상)는 앞에서 본 약 2%입니다. 한 번에 2%라도 비교를 여러 번 하면 이야기가 달라집니다. 공정한 동전 20개를 10번씩 던지면, 적어도 하나가 선을 넘을 확률은 약 35%입니다. 비교를 여러 번 하고도 그에 맞게 보정하지 않는 것은 의학 연구에서 흔한 통계 오류로 꼽힙니다 (PMID 37234723).

0.05는 사람이 정한 관례이고, 선 바로 위와 바로 아래의 p값은 거의 같은 정도의 증거입니다.

얼마나 큰 차이인가

이번에는 다른 동전을 10,000번 던졌다고 해 보겠습니다. 앞면이 5,150번 나왔습니다. 51.5%, 공정한 동전의 50%와 거의 같습니다. 그런데 공정한 동전이라면 이만큼 또는 그보다 더 쏠릴 확률을 계산하면 약 0.003, 1,000번에 3번꼴입니다. 친구의 동전보다 p값이 훨씬 작습니다.

두 동전을 나란히 놓아 보겠습니다. 친구의 동전은 앞면이 90%였고 p값은 약 0.02입니다. 두 번째 동전은 앞면이 51.5%였고 p값은 약 0.003입니다. 쏠림이 훨씬 작은 쪽의 p값이 더 작습니다. 둘을 가른 것은 던진 횟수입니다. 많이 던질수록 앞면 비율의 들쭉날쭉함이 작아져서, 아주 작은 쏠림도 「우연치고는 드물다」는 판정을 받습니다.

두 동전을 나란히 놓은 도판. 왼쪽 친구의 동전은 10번 던져 앞면 90%, p값 약 0.02다. 오른쪽 다른 동전은 10,000번 던져 앞면 51.5%로 한가운데(50%)를 겨우 넘었는데, p값은 약 0.003이다. 쏠림은 왼쪽이 훨씬 큰데 p값은 오른쪽이 더 작다.

그래서 p값과 따로, 차이가 얼마나 큰지를 재는 숫자가 필요합니다. 효과크기는 차이가 얼마나 큰지를 재는 값입니다. 동전이라면 「앞면이 몇 %인가」이고, 약이라면 「위험 50% 감소」나 「100명 중 2명이 1명으로」 같은 숫자입니다. 이 두 숫자를 읽는 법은 「위험이 절반으로 줄었다면, 몇 명이 덜 아픈가 — 상대위험과 절대위험」에서 다뤘습니다. 평균의 차이, 위험의 차이, 위험의 비 같은 효과크기가 문헌에 70가지 넘게 기술돼 있습니다 (PMID 29337724).

p값을 내는 검정은 효과가 얼마나 큰지도, 임상적으로 중요한지도 알려 주지 않습니다 (PMID 29337724). 실제 기록에서도 두 번째 동전과 같은 일이 일어납니다. 무릎과 엉덩관절 인공관절 수술 기록 95만여 건이 담긴 국가 데이터베이스에서, 짝지을 의학적 이유가 전혀 없는 변수들을 난수로 20쌍 골라 짝지은 연구가 있습니다. 그 가운데 14쌍에서 p값이 0.05보다 작았습니다 (PMID 40885217). 효과가 전혀 없는 비교라면 20쌍 가운데 1쌍꼴이 선을 넘는 것이 보통이니, 14쌍은 여러 번 비교한 탓으로는 설명되지 않는 수입니다. 저자들은 이 유의성이 오로지 표본 크기가 만든 것이고 임상적 의미는 없다고 결론짓습니다. 그리고 가설을 먼저 세우고 분석할 것과 효과크기를 해석할 것을 권합니다.

반대로, 통계적으로 유의하다는 판정은 났는데 그 차이의 크기가 의미 있는지가 물음으로 남는 경우도 있습니다. 류마티스 관절염이 있는 성인의 무작위 시험 5편 자료를 다시 계산한 연구에서, 유산소 운동은 스스로 느끼는 피로를 통계적으로 유의하게 줄였습니다(p=0.006). 평균적으로 줄어든 피로는 환자가 의미 있다고 느끼는 최소한의 차이의 3분의 1쯤이었고, 범위를 붙여도 그 차이의 절반을 조금 넘는 데까지였습니다. 저자들은 기존에 정해진 기준에 비추어, 임상적으로 의미 있을 만큼 피로가 준 사람은 많지 않았을 수 있다고 결론짓습니다. 피로가 심한 사람들에서 연구가 더 필요하다고도 적습니다 (PMID 29609204).

말 자체도 헷갈림을 부릅니다. 영어 significant는 일상어로 「중요하다」는 뜻이라, p가 0.05보다 작은 결과를 그렇게 부르면 어떤 사람들은 곧바로 임상적으로 의미 있다는 증명처럼 받아들이는 오해에 빠집니다 (PMID 32710113). 한국어 「유의(有意)」도 글자로는 「뜻이 있다」는 말이라, 비슷한 오해를 부를 수 있습니다.

p값의 크기와 차이의 크기는 서로 다른 숫자이고, 차이가 얼마나 큰지는 효과크기가 말합니다.

그 동전은 어디서 왔나

친구의 동전으로 돌아가겠습니다. 10번 중 9번 앞면, p값은 약 2%였습니다. 이것을 「이 동전이 공정할 확률은 2%」로 읽고 싶어집니다. 그런데 두 문장은 방향이 반대입니다. p값은 「공정하다면, 이런 결과가 나올 확률」이고, 알고 싶은 것은 「이런 결과가 나왔을 때, 공정할 확률」입니다.

같은 9번이라도 동전이 어디서 왔는지에 따라 읽는 법이 달라집니다. 은행에서 막 바꿔 온 동전이라면 처음부터 휜 동전일 가능성이 아주 낮아서, 9번은 드문 우연 쪽으로 읽힐 수 있습니다. 마술사가 건넨 동전이라면 이야기가 다릅니다. 그런데 두 경우 모두 p값은 똑같이 약 2%입니다. p값을 계산할 때 동전의 출처는 들어가지 않기 때문입니다.

두 칸으로 나란히 그린 삽화. 왼쪽은 은행 창구에서 막 바꿔 온 동전, 오른쪽은 마술사가 건넨 동전이다. 두 칸 모두 동전 10개 가운데 9개가 앞면으로 똑같고 p값도 똑같이 약 2%지만, 어디서 온 동전인지에 따라 휘었을 가능성은 다르게 읽힌다.

연구도 같습니다. 연구를 하기 전에 진짜 차이가 있을 가능성이 얼마였는지가 결과를 해석하는 데 결정적이고, p값은 「우연히 나온 결과일 확률」과 같지 않습니다 (PMID 32169596). p값 오해 열두 가지를 정리한 한 해설은, 그 가운데 가장 심각한 결과로 실험 하나의 데이터만으로 「이 결론이 틀렸을 확률」을 계산할 수 있다고 믿는 것을 꼽습니다. 그 확률을 따지려면 바깥의 근거와, 기전이 그럴듯한지가 함께 있어야 한다는 것입니다 (PMID 18582619).

p값의 역사와 오해를 정리한 한 종설은, p값을 귀무가설이 참일 확률로 믿는 것을 0.05에 기대 온 관행이 키운 오해로 꼽습니다. 그러면서도 p값은 제대로 해석하면 쓸모 있는 정보를 줄 수 있고, 다만 추론의 유일한 기준으로 쓰지는 말라고 결론짓습니다 (PMID 41250654).

p값은 「효과가 없다면 이런 결과가 얼마나 드문가」이고, 「이 결과를 보고 효과가 없을 확률」과는 방향이 반대입니다.

「유의하지 않다」와 「효과가 없다」

이번에는 앞면이 60% 나오도록 일부러 휘게 만든 동전이 있다고 해 보겠습니다. 이 동전은 분명히 휘었습니다. 이것을 10번 던져서 0.05 선을 넘으려면 앞면이든 뒷면이든 한쪽이 9번 이상 나와야 합니다. 계산해 보면 이 동전으로 그런 결과가 나올 확률은 약 5%입니다. 공정한 동전이 선을 넘을 확률(약 2%)보다 두 배 남짓 높을 뿐입니다. 10번 던지기를 100번 되풀이하면 95번쯤은 「통계적으로 유의한 차이 없음」으로 끝납니다.

동전이 휘었는데도 결과는 대개 「유의하지 않다」입니다. 60%짜리 쏠림을 가려내기에 10번은 너무 적은 횟수이기 때문입니다. 「유의하지 않다」가 말하는 것은 「이 데이터로는 효과가 없다는 가정을 밀어내지 못했다」까지이고, 「효과가 없다」는 그보다 한 걸음 더 나간 말입니다.

증거가 없다는 것이 없다는 증거는 아닙니다. 통상적인 p값 분석은 귀무가설에 반대하는 쪽으로만 논증할 수 있고, 귀무가설을 지지하는 쪽으로는 결코 논증할 수 없습니다 (PMID 41151754).

그런데 논문 제목과 초록은 이 구분을 자주 놓칩니다. 동물의 인지와 가까운 분야의 연구들에서 유의하지 않은 결과를 어떻게 적었는지 손으로 분류한 조사가 있습니다. 그 결과를 「효과 없음」으로 적은 비율이 제목에서 84%, 초록에서 64%였고, 「유의하지 않음」이라고 적은 제목은 하나도 없었습니다 (PMID 36919170). 본문의 결과 부분에서는 「유의하지 않음」이라는 표현이 절반쯤이었습니다. 저자들은 이 분야 연구가 의미 있는 크기의 효과를 잡아내기에 힘이 모자란 경우가 많다고 적고, 효과가 없다는 주장의 근거를 주의 깊게 살피고 유의하지 않은 결과를 형식에 맞게 정확히 적으라고 권합니다.

의학에도 예가 있습니다. 술을 줄이도록 돕는 짧은 상담은 여러 시험을 모아 합친 분석들로 효과가 확인됐지만, 효과가 작아서 무작위 시험 하나하나에서는 유의하지 않은 결과가 자주 나온다고 한 종설은 적습니다. 그런 결과 때문에 일상 진료에서 상담이 이로운지를 의심하게 되는 일도 있다는 것입니다. 이 종설은 유의한 차이가 없다는 것을 차이가 없다는 증거로 삼는 것을 「귀무가설을 증명하기」의 오류라고 부릅니다 (PMID 25076917).

진짜 효과가 있을 때도 선을 넘는지는 들쭉날쭉합니다. 진짜 효과가 있고, 그 효과를 10번 중 8번은 잡아내도록 설계된 연구 두 편이 있다고 해 보겠습니다. 이때 한 편은 유의하고 다른 한 편은 유의하지 않은 엇갈린 결과가 3번에 1번꼴로 나옵니다 (PMID 28698825). 그래서 다시 해 본 연구가 유의하지 않다는 것만으로 재현에 실패했다고 볼 수는 없습니다.

효과가 없다는 쪽을 따지고 싶다면 질문 자체를 바꾸는 방법들이 있습니다. 「차이가 있는가」 대신 「차이가 의미 있는 크기보다 작은가」를 묻는 방법들이고, 이런 방법으로는 귀무가설에 대해 직접 결론을 끌어낼 수 있습니다 (PMID 41151754). 다만 그런 방법들을 소개한 논문도 한계를 함께 적습니다. 어떤 통계적 방법도 귀무가설이 참이라는 것을 증명할 수는 없습니다 (PMID 30873486).

기사 제목을 하나 읽어 보면

「새 치료, 통계적으로 유의한 개선」과 「보충제 B, 기억력에 효과 없어」. 이런 두 제목을 만났다고 해 보겠습니다. 둘 다 이 글이 만든 가상의 제목입니다.

첫 제목의 「유의하다」가 알려 주는 것은 하나입니다. 치료에 효과가 전혀 없다면 이만한 차이는 드물게 나온다는 것입니다. 차이가 얼마나 큰지, 치료가 정말 효과가 있을 확률이 얼마인지는 이 말에 들어 있지 않습니다. 그래서 먼저 물을 것은 「얼마나 큰 차이였나?」입니다. 답은 「100명 중 몇 명」이나 「점수가 몇 점」 같은 효과크기로 옵니다.

함께 물을 것은 「몇 명을 봤나?」입니다. 10,000번 던진 동전은 51.5%로도 선을 넘었고, 95만여 건의 수술 기록에서는 의학적 이유 없이 짝지은 변수 20쌍 가운데 14쌍이 선을 넘었습니다 (PMID 40885217). 아주 많은 사람을 본 연구에서 「유의하다」는 아주 작은 차이를 가리킬 수 있습니다.

둘째 제목 「효과 없어」에는 다른 물음이 붙습니다. 이 연구는 효과를 찾지 못한 것인가, 아니면 효과가 의미 있는 크기보다 작다는 것을 보이도록 설계된 것인가? 60%로 휜 동전도 10번 던지기로는 대개 「유의하지 않음」이었습니다. 몇 명을 봤는지, 무엇을 보이려고 설계했는지가 기사에 없다면, 그 제목이 말한 것은 「이 연구로는 효과를 찾지 못했다」까지입니다 (PMID 41151754).

두 제목 모두에서 「얼마나 큰 차이였나?」가 같은 일을 합니다. 효과크기는 값 하나에 그럴듯한 값들의 범위 전체를 함께 붙여야, 실제 효과가 얼마나 크거나 작을 수 있는지, 그래서 얼마나 중요할 수 있는지를 따질 수 있습니다 (PMID 29337724). 데이터와 어울리는 효과의 크기에 대한 정보는 값 하나와 그 범위에서 얻어야 합니다 (PMID 28698825). 「효과 없어」라는 연구라도 그 범위가 큰 효과까지 뻗어 있다면, 그 연구는 효과가 없다는 쪽도 있다는 쪽도 가려내지 못한 것입니다. 대규모 재현 프로젝트 세 곳의 자료에서도, 「귀무 결과」였던 원 연구와 재현 연구 가운데 많은 수가 실제로는 이렇게 결론을 내리지 못한 경우였습니다 (PMID 38739437).

어떤 제목이든 「통계적으로 유의했다」나 「유의한 차이 없어」를 들으면 「얼마나 큰 차이였나?」를 물으면 됩니다. p값이 답하지 않는 그 질문에는 효과크기와 그 범위가 답합니다.

어디를 더 볼까

이 글은 동전 하나로 p값의 뜻만 다뤘습니다. 표본의 크기, 여러 번의 비교, 분석하는 사람의 선택이 실제 논문에서 p값을 어떻게 움직이는지는 「p=0.03은 무엇의 확률인가 — p값이 답하는 하나의 질문」이 이어서 다룹니다.

0.05라는 선이 어디서 왔는지, 그리고 유의한 결과가 사실은 몇 명의 사건에 달려 있는지를 세는 법은 「0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법」이 봅니다. 효과크기로 쓰이는 「위험 50% 감소」와 「100명 중 몇 명」은 「위험이 절반으로 줄었다면, 몇 명이 덜 아픈가 — 상대위험과 절대위험」에서 다뤘습니다.

「숫자 첫걸음」의 다른 글들은 효과크기에 붙는 범위를 읽는 신뢰구간, 그리고 같이 움직인다고 원인은 아니라는 교란을 다룹니다. 「얼마나 큰 차이였나?」의 답은 신뢰구간 편에서 이어집니다.

근거 논문

  • "Moving Beyond p < 0.05 in Ecotoxicology: A Guide for Practitioners." (2020) — PMID 32539165 — p값은 귀무가설이 참일 때 관측값과 같거나 더 큰 값을 볼 확률이다. 2019년 미국통계학회 사무총장이 「통계적 유의성」이라는 말을 쓰지 말자고 권했다.
  • "P-value, compatibility, and S-value." (2022) — PMID 37637018 — p값은 검정 가설과 배경 가정을 포함한 모형과 데이터 사이의 양립성 지표로 해석된다.
  • "Semantic and cognitive tools to aid statistical science: replace confidence and significance by compatibility and surprise." (2020) — PMID 32998683 — p값과 구간 추정을 분석 가정 전체와 데이터의 양립성으로 다시 읽고, 「유의성」 대신 「양립성」으로 가르치라고 권한다.
  • "Goodbye P<0.05. P-value is simply one item among many to gauge scientific evidence." (2026) — PMID 41748420 — 한 세기 쓰인 0.05는 임의의(그러나 신성시된) 선이다. 여러 통계학자·연구자가 p값 자체가 아니라 0.05라는 선과 「통계적 유의성」이라는 말을 버리자고 권한다(짧은 종설).
  • "The earth is flat (p > 0.05): significance thresholds and the crisis of unreplicable research." (2017) — PMID 28698825 — 검정력 80%에서 진짜 효과가 있어도 두 연구가 3분의 1의 경우에 엇갈린다. 유의하지 않다는 이유만으로 재현 실패로 볼 수 없다. p값은 증거의 세기를 나타내는 등급으로 읽어야 하고, 효과 크기 정보는 점추정과 구간추정에서 얻어야 한다.
  • "Reflection on modern methods: Statistics education beyond 'significance'…" (2021) — PMID 32710113 — 'significant'가 일상어로 「중요하다」를 뜻해 임상적 관련성의 증명으로 오해된다. p<0.05 여부가 아니라 정확한 p값을 해석하도록 가르치라고 권한다.
  • "Statistical significance: p value, 0.05 threshold, and applications to radiomics-reasons for a conservative approach." (2020) — PMID 32157489 — 임상 연구는 결정을 위해 이분법적 답이 필요하므로 보수적 접근, 곧 현행 0.05와 이분법 판정을 유지하자고 주장한다. 0.005로 낮추자는 제안을 소개하며 연구 비용 증가를 우려하고, 실제 p값을 늘 적으라고 권한다.
  • "Misleading medical literature: An observational study." (2022) — PMID 34355494 — JAMA·Lancet·NEJM 20년치에서 0.05 근처 p값을 해석한 문장 400개: 0.05 위쪽 97개 중 40개가 유의한 것처럼, 아래쪽 303개 중 4개가 유의하지 않은 것처럼 적혔다. 오도는 0.05 위쪽에서 더 흔했다.
  • "Statistics in medical research: Common mistakes." (2023) — PMID 37234723 — 흔한 통계 오류로 다중비교 보정 누락, p값을 효과 크기나 임상적 관련성의 척도로 오해하는 것 등을 든다.
  • "Statistical Significance Versus Clinical Importance of Observed Effect Sizes: What Do P Values and Confidence Intervals Really Represent?" (2018) — PMID 29337724 — 효과크기 지표는 70가지 넘게 기술돼 있다. 검정 결과는 크기도 임상적 중요성도 알려 주지 않으므로 점추정에 그럴듯한 값의 범위 전체를 붙여야 한다(튜토리얼).
  • "Fully Randomized Predictor-Outcome Pairings Using a National Database Yield Frequent Statistical Significance Without Clinical Meaning." (2025) — PMID 40885217 — 인공관절 수술 955,092건에서 난수로 짝지은 20쌍 중 14쌍(70%)이 p<0.05. 저자들은 표본 크기 탓이라 결론짓고 가설 주도 방법과 효과크기 해석을 권한다.
  • "Aerobic Exercise and Fatigue in Rheumatoid Arthritis Participants: A Meta-Analysis Using the Minimal Important Difference Approach." (2018) — PMID 29609204 — 무작위 시험 5편 자료: 유산소 운동이 자가보고 피로를 유의하게 줄였으나(p=0.006), 기존 기준에 비추어 상당수가 임상적으로 의미 있는 감소를 얻었을 가능성은 낮을 수 있다. 피로가 심한 사람에서 추가 연구가 필요하다.
  • "How to understand and teach P values: a diagnostic test framework." (2020) — PMID 32169596 — 연구 전 참인 차이의 확률이 해석에 결정적이다. p값은 우연한 발견일 확률과 같지 않다(진단검사 비유 튜토리얼, 비유의 한계도 적는다).
  • "The P Value: What It Is and What It Is Not." (2025) — PMID 41250654 — 0.05 관행이 p값을 귀무가설이 참일 확률로 믿거나 유의성을 임상적 중요성으로 믿는 오해를 키웠다. 제대로 해석하면 p값은 유용한 정보를 줄 수 있으나 추론의 유일한 기준으로 쓰지 말라고 결론짓는다(종설).
  • "A dirty dozen: twelve p-value misconceptions." (2008) — PMID 18582619 — p값 오해 가운데 가장 심각한 결과는 외부 근거나 기전의 그럴듯함 없이 단일 실험 데이터만으로 결론이 틀릴 확률을 계산할 수 있다고 믿는 것이다(해설).
  • "Saying 'no' with confidence: statistical approaches to test for the absence of an effect." (2025) — PMID 41151754 — 통상적 p값 분석은 귀무가설에 반대하는 논증만 할 수 있다. 동등성 검정·구간 등으로 의미 있는 효과의 부재를, 우도비·베이즈 인자로 효과 자체의 부재를 따지면 귀무가설에 대해 직접 결론을 낼 수 있다(생물학자용 안내).
  • "Reporting and interpreting non-significant results in animal cognition research." (2023) — PMID 36919170 — 동물 인지와 관련 분야에서 유의하지 않은 결과를 「효과 없음」으로 적은 비율이 제목 84%·초록 64%·결과 절 41%, 「유의하지 않음」은 제목 0%·초록 26%·결과 절 52%. 힘이 낮은 연구가 많은 분포와 일치한다.
  • "Interpreting null findings from trials of alcohol brief interventions." (2014) — PMID 25076917 — 짧은 음주 상담은 메타분석으로 효과가 확립됐으나 효과가 작아 개별 시험에서 유의하지 않은 결과가 흔하고, 이것이 회의론을 낳는다. 차이 없음을 차이 없다는 증거로 삼는 「귀무가설 증명」의 오류를 짚는다(종설).
  • "Replication of null results: Absence of evidence or evidence of absence?" (2024) — PMID 38739437 — 원 연구와 재현 연구가 둘 다 유의하지 않다고 효과 부재의 증거가 되지는 않는다. 대규모 재현 프로젝트 자료에서 「귀무 결과」인 원 연구·재현 연구 가운데 많은 수가 실제로는 결론을 내리지 못한 것이었다.
  • "Making 'null effects' informative: statistical techniques and inferential frameworks." (2018) — PMID 30873486 — 동등성 검정·베이즈 추정·베이즈 인자로 귀무 결과를 평가하는 법. 어떤 통계적 접근도 귀무가설이 참임을 증명할 수는 없다.
📚 숫자 첫걸음 — 기사 속 숫자를 처음 읽는 사람을 위해
2 / 4
  1. 1.위험이 절반으로 줄었다면, 몇 명이 덜 아픈가 — 상대위험과 절대위험
  2. 2.「통계적으로 유의했다」는 무엇을 말하나 — 동전 던지기로 읽는 p값
  3. 3.한 번 센 숫자는 얼마나 흔들리나 — 괄호 안 두 숫자, 신뢰구간
  4. 4.먹는 사람이 더 오래 산다면, 그 사람들은 원래 어떻게 달랐을까 — 교란
← 이전 글위험이 절반으로 줄었다면, 몇 명이 덜 아픈가 — 상대위험과 절대위험다음 글 →한 번 센 숫자는 얼마나 흔들리나 — 괄호 안 두 숫자, 신뢰구간

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.