
Paperis 아티클
연구자 자유도와 p-해킹 — 조작 없이도 원하는 결과가 나오는 법
각각은 합리적인 분석 선택이 결과를 보며 쌓이면 위양성이 늘어나는 이유, 그리고 이를 재고 줄이려는 도구들
연구자 자유도와 p-해킹 — 조작 없이도 원하는 결과가 나오는 법
이 개념이 답하는 질문
연구 부정이라고 하면 대개 없는 데이터를 지어내거나, 숫자를 고치거나, 남의 글을 베끼는 장면이 떠오릅니다. 그런데 "어떤 관행에 관여해 본 적이 있느냐"고 연구자에게 물은 설문들을 모아 분류하고 순위를 매겨 보면 목록의 순서가 정반대입니다. 가장 흔하게 보고된 항목은 분석을 고르는 것, 인용을 고르는 것, 공변량(결과에 영향을 줄 수 있어 분석에 함께 넣는 다른 변수)을 고르는 것이었고, 조작·날조·표절은 가장 드문 쪽에 있었습니다. 이 연구는 정보를 더하거나 바꾸는 행위보다 빼는 행위가 더 자주 보고된다는 점도 짚었습니다 (PMID 41963575).
빼는 행위가 이 글의 주제입니다. 위 목록의 상위 항목들(분석·인용·공변량 선택)은 어느 것도 그 자체로는 규칙 위반이 아닙니다. 이상치(다른 값들과 크게 동떨어진 측정값)를 제거하는 것도, 공변량을 통제하는 것도, 표본을 조금 더 모으는 것도 정당한 판단일 수 있고 교과서가 권하는 것도 있습니다. 문제는 이 판단들이 결과를 곁눈질하며 내려질 때 생깁니다.
2011년 논문 한 편이 이 문제에 이름을 붙였습니다. 이 논문은 심리학자들이 위양성률(효과가 없는 연구가 유의하게 나오는 비율)을 5% 이하로 유지하는 것을 명목상 지지하면서도, 자료 수집·분석·보고의 유연성 때문에 실제 위양성률이 극적으로 올라간다는 것을 시뮬레이션과 실험 두 건으로 보였습니다. 논문의 표현으로는 많은 경우 연구자가 없는 효과를 있다고 잘못 판정할 확률이 없다는 것을 옳게 판정할 확률보다 높습니다 (PMID 22006061). 이 유연성의 원천, 곧 연구자가 데이터를 모으고 분석하고 보고하면서 정당하게 달리 고를 수 있는 선택지에 붙은 이름이 연구자 자유도(researcher degrees of freedom)입니다. 유의하지 않던 결과를 유의하게 만들려고 이 선택지들을 이리저리 바꾸는 전략을 통틀어 p-해킹이라고 부릅니다 (PMID 36778954). 여기서 유의하다는 것은 p값이 .05보다 작다는 뜻이고, p값은 실제로는 차이가 없다고 가정했을 때 이만큼 이상의 차이가 우연히 나올 확률입니다(「p=0.03은 무엇의 확률인가 — p값이 답하는 하나의 질문」). 이 문제가 주목받게 된 배경은 「심리학의 재현 위기 — 우리가 믿었던 발견들은 왜 흔들렸나」에 있습니다.
자유도를 쓰는 일은 드물지 않습니다. 심리학자 2,000여 명에게 솔직하게 답할 때 보상이 따르는 익명 조사를 했더니, 의심스러운 연구관행(조작은 아니지만 책임 있는 연구에서 벗어난 회색지대 관행)에 관여한 비율이 놀라울 만큼 높았고, 저자들은 일부 관행이 연구계의 표준 규범일 수 있다고 결론지었습니다 (PMID 22508865). 네덜란드 전 분야 연구자 6,813명 조사에서는 문제적 관행 가운데 적어도 한 가지에 자주 관여한다는 응답이 51.3%였고, 날조는 4.3%, 변조는 4.2%였습니다 (PMID 35171921). 날조·변조는 응답자를 보호하는 별도 방식으로 물었기 때문에 엄밀한 비교는 아니지만 격차가 큽니다. 문제의 무게중심은 사기꾼보다 재량에 놓여 있습니다.
자유도는 어디에 있나
자유도는 가설을 세우는 단계부터 설계·실행·분석·보고까지 연구의 모든 단계에 있습니다. 한 개관 논문은 심리학 연구에서 연구자가 쥔 자유도를 34개로 정리했습니다 (PMID 27933012). 몇 개만 열어 보겠습니다.
이상치 처리가 첫째입니다. 반응시간(자극을 보고 얼마나 빨리 반응하는지)을 재는 연구에서는 이상치를 다루는 방법이 여러 가지 나란히 표준으로 통용됩니다. 시뮬레이션으로 보니 무엇을 고르느냐에 따라 p값이 부풀고 신뢰구간과 효과크기가 왜곡되었습니다. 베이즈 추정과 꼬리가 두꺼운 분포를 쓰면 이상치를 따로 처리할 필요가 없어지지만, 논문은 그 대가로 또 다른 유연성이 열린다고 덧붙입니다 (PMID 37691812).
제외 기준은 분석에서 뺄 참가자를 가르는 규칙입니다. 공포조건화 연구(어떤 신호와 불쾌한 자극을 짝지어 공포 반응을 학습시키는 실험)에서는 '학습하지 않은 사람'과 '반응하지 않은 사람'을 빼는 것이 관행인데, 이 사람들을 어떻게 정의할지에는 합의가 없습니다. 저자들은 문헌검색으로 제외 기준이 제각각임을 확인한 뒤, 기존 데이터를 정의만 바꿔 다시 분석해 결론이 어떻게 달라지는지 보였습니다 (PMID 31841112).
공변량은 앞에서 말한 대로 분석에 함께 넣는 다른 변수이고, 무엇을 넣어야 하는지는 「"연령·성별·BMI 보정"은 무엇을 했나 — 교란과 보정을 읽는 법」에서 다룹니다. 구조 뇌영상(뇌 부위의 크기를 재는 영상) 논문 2년치에서 한 모델에 들어간 공변량은 0개부터 14개까지였고, 68개 모델에 37가지 조합이 쓰였습니다. 같은 공개 데이터로 검증하니 어떤 조합은 결과를 거의 바꾸지 않았고, 어떤 조합은 결과의 양상을 크게 바꿔 놓았습니다 (PMID 31568872).
전처리는 측정한 원자료를 분석하기 좋게 다듬는 단계입니다. 뇌파 연구(ERP)의 N400 실험 데이터 하나에 문헌에서 볼 수 있는 방법의 범위를 보여 주도록 고른 14개의 처리 순서(파이프라인)를 적용하자, 고역통과 필터 차단주파수·잡파 제거법·기저선 길이·기준전극·측정 시점과 위치·진폭 측정 방식이 모두 결과 지표의 적어도 일부에 영향을 줬습니다. 저역통과 필터만 어느 지표에도 뚜렷한 영향을 주지 않았습니다 (PMID 38961523).
연구자가 선택으로 느끼지 못하는 자리에도 자유도가 있습니다. 같은 통계 검정을 SPSS·SAS·Stata·R에서 돌려 손계산과 맞춰 본 연구에서, 2×2 표의 카이제곱 검정은 프로그램에 따라 p값 차이가 .005에서 .162까지 벌어졌고, 차이는 주로 표본 크기에 따라 달랐습니다. 저자들은 어떤 프로그램을 썼는지에 따라 결론이 달라질 수 있다고 논의합니다 (PMID 35953660).
마지막 자리는 보고 단계입니다. 결과를 본 뒤에 만든 가설을 처음부터 가지고 있던 것처럼 쓰는 관행에는 1998년에 이미 HARKing(Hypothesizing After the Results are Known, 결과를 안 뒤에 가설 세우기)이라는 이름이 붙었습니다 (PMID 15647155).
왜 합리적인 선택들이 합치면 위양성이 되나
선택 하나하나가 합리적이어도 합치면 위양성이 늘어나는 까닭은 다중검정, 곧 같은 질문에 검정을 여러 번 하는 데 있습니다. 유의수준 .05는 실제로 효과가 없어도 대략 스무 번에 한 번은 유의한 결과가 나오도록 정한 기준입니다. 자유도가 여럿이고 각각이 몇 가지 값을 가지면 수행 가능한 분석의 수는 곱으로 불어납니다. 그중 가장 잘 나온 하나만 보고하면서 유의수준은 .05를 그대로 쓰면 실제 위양성률은 .05가 아닙니다. 분석들이 서로 비슷하면 계산대로 늘지는 않지만 방향은 같습니다.

더 결정적인 점은 그 분석들을 실제로 다 돌려 볼 필요조차 없다는 것입니다. 데이터를 보고 "이 경우엔 이렇게 하는 게 맞겠다"고 판단하는 것만으로도 충분할 수 있습니다. 다른 데이터가 왔다면 다른 판단을 했을 것이므로, 실제로 돌린 분석은 이미 가능했던 여러 분석 중 하나를 고른 결과입니다 (DOI: 10.1002/essoar.10500564.1).
이 팽창은 시뮬레이션으로도 보입니다. 음성학의 자유도를 다룬 프리프린트(동료심사 전)는 1종 오류(위양성과 같은 말입니다) 시뮬레이션으로 자유도를 탐색할 때 위양성이 심하게 부푸는 것을 직접 보였습니다 (DOI: 10.31234/osf.io/fp4jr). 시뮬레이션은 아니지만 논변도 있습니다. 지층에서 주기를 찾는 순환층서학에서는 통계적 주기 탐지 성공률이 100%에 가깝다는 사실 자체가 확증 편향(원하는 결과를 확인하는 쪽으로 기우는 경향)의 징후라고 한 프리프린트(동료심사 전)가 있습니다. 데이터를 본 뒤 내리는 선택 하나하나는 가지 않은 길이 있었다는 뜻이라는 논리입니다 (DOI: 10.1002/essoar.10500564.1). p-해킹 전략은 한 가지가 아니어서, 문헌에서 12가지 전략을 추려 시뮬레이션한 연구는 전략마다 위양성률을 올리는 정도가 달라 전략별로 따로 살펴야 대책의 근거가 넓어진다고 보았습니다 (PMID 36778954).
밖에서 재는 법 ① 같은 데이터를 여러 팀에게
자유도가 결과를 얼마나 흔드는지 가장 직접 보는 방법은 같은 데이터와 같은 가설을 여러 팀에 주고 각자 분석하게 하는 것입니다. 연구자 161명을 73개 팀으로 묶어 "이민이 늘면 사회정책 지지가 줄어드는가"를 같은 데이터로 검증하게 한 연구에서 팀들은 수치도 결론도 크게 갈렸습니다. 곤란한 대목은 그다음입니다. 전문성도 사전 신념도 기대도 이 차이를 거의 예측하지 못했고, 각 팀의 식별 가능한 모든 결정을 코딩해 넣은 뒤에도 수치 결과 분산의 95% 이상이 설명되지 않은 채 남았습니다. 저자들은 이를 한 연구만 볼 때는 보이지 않는 "숨은 불확실성의 우주"라고 불렀습니다 (PMID 36306328). 한 편의 연구 결과는 그 팀이 고른 길 하나의 결과일 수 있다는 뜻입니다.
밖에서 재는 법 ② 멀티버스와 명세곡선
한 논문의 결과가 특정한 선택 조합 위에만 서 있는지는 정당하다고 볼 만한 조합을 모두 돌려 보면 알 수 있습니다. 이렇게 가능한 분석 경로를 전부 펼친 집합을 멀티버스라 하고, 한 번의 분석을 이루는 선택의 조합을 명세라 합니다. 명세곡선 분석(specification curve analysis)은 모든 명세의 결과를 한 장의 그래프에 늘어놓는 방법으로, 세 단계로 이루어집니다. 이론적으로 정당하고 통계적으로 타당하며 중복되지 않는 명세를 모두 찾아내고, 결과를 그래프로 펼쳐 어떤 결정이 결과를 좌우했는지 독자가 보게 하고, 전체 명세에 걸친 결합 추론(전체를 한꺼번에 놓고 하는 통계적 판단)을 수행합니다 (PMID 32719546). 이 방법이 보여 주는 것은 정당하다고 본 명세들 전체에서 결과가 얼마나 유지되는가입니다. 명세 집합 밖의 타당성(측정·설계)이나 결과의 참 여부는 별개의 질문입니다.
멀티버스에서는 결과가 선택에 따라 정반대 방향으로 갈리기도 합니다. 붉은 고기와 전체 사망률의 관계를 다룬 연구는 미국 NHANES 관찰자료(10,661명)에서 가공하지 않은 붉은 고기를 분석했습니다. 기존 문헌에서 70가지 분석 방법을 뽑아 1,208개 명세를 돌렸습니다. 해저드비(같은 기간에 사건이 일어나는 속도를 두 집단끼리 나눈 값, 「해저드비 0.7은 무엇의 0.7인가 — 생존곡선 읽는 법」)가 1 이상이면 붉은 고기가 사망을 늘리는 쪽, 1 미만이면 줄이는 쪽을 가리킵니다. 435개(36.0%)가 1 이상, 773개(64.0%)가 1 미만이었고, 통계적으로 유의한 것은 48개(3.97%)였는데 그중 40개는 붉은 고기가 사망률을 낮춘다고, 8개는 높인다고 가리켰습니다 (PMID 38354868). 해저드비 중앙값은 0.94(사분위 범위 0.83~1.05)였습니다 (PMID 38354868). 같은 자료에서 정당한 분석들이 서로 다른 방향의 결과를 냈다는 뜻입니다. 다만 이 연구의 목적은 붉은 고기의 영향을 판정하는 것이 아니라 영양역학에서 이 방법을 쓸 수 있음을 보이는 것이었습니다.

불안과 공포학습의 관계를 피부전기활동(땀샘 반응으로 재는 전기 신호)으로 잰 문헌에 1,240개 분석을 적용했을 때는 이론과 부합하는 유의 효과가 1.45%에서만 나왔습니다. 저자들은 피부전기활동으로 잰 불안군-비불안군 공포학습 차이가 연구자 자유도에 취약하다고 결론지었습니다 (PMID 39142133). 메타분석(여러 연구를 모아 다시 계산하는 분석, 「메타분석은 평균을 내지 않는다 — 숲그림의 마름모가 만들어지는 법」)도 선택의 대상입니다. 옥시토신 투여 연구 185편에서 뽑은 효과크기 530개로 포함 기준·종합 모형·출판편향 보정법을 바꿔 가며 256개의 메타분석을 돌리자 요약 효과크기(두 집단 평균 차이를 데이터의 흩어진 정도로 나눈 값 d)가 d = -0.16에서 1.45까지 흩어졌습니다. 다만 같은 논문은 그 90% 이상이 효과가 없다고 가정해 만든 부트스트랩 범위(자료를 무작위로 다시 뽑아 만든 범위)를 넘어섰다는 점도 보고했고, 저자들은 선택과 관계없이 근거가 대체로 효과의 존재를 지지한다고 보았습니다 (PMID 40848964).
같은 방식으로 등록형 재현 보고(여러 연구실이 사전등록한 같은 절차로 같은 실험을 되풀이한 프로젝트)의 데이터를 펼친 연구가 있습니다. 이 연구는 사전등록이 없어서 유의성에 따라 선택적으로 보고할 수 있었다면 어떤 편향이 생겼을지를 가정해 보았습니다. 294개 연구의 멀티버스에는 보통 수천 개의 결과가 있었는데도 가설 방향으로 유의한 효과가 나온 것은 약 30%의 연구뿐이었습니다. 선택적 보고는 메타분석의 결론을 바꾸고 편향을 만들 수 있었고, 한 자유도의 효과가 같은 프로토콜을 쓴 다른 표본들에서 일관되지 않아 멀티버스 분석 결과 자체가 표본 사이에서 재현되지 않는 일도 잦았습니다 (PMID 37166859).
한계도 있습니다. 멀티버스를 짜는 일이 무겁고, 어떤 선택지를 왜 정당한 대안으로 인정했는지 기록이 빠지기 쉽습니다. 멀티버스에 무엇을 넣을지도 연구자의 판단이라는 뜻이고, 이를 표준화하려는 등록 도구가 나와 있습니다 (PMID 41164340). 해석에도 결이 필요합니다. 스마트폰 사용 로그에 16,128개 명세를 돌린 작업논문(동료심사 전)은 사용 시간 같은 절대값이 최대 세 배 가까이 달라졌지만 참가자들 사이의 순위는 안정적이었다고 보고했습니다 (DOI: 10.2139/ssrn.7008242). 연구 사이에서 절대값을 비교하기는 어렵고 개인 간 비교는 비교적 단단하다는 해석이 가능합니다.
밖에서 재는 법 ③ p-curve
개별 논문이 아니라 문헌 전체를 검사하는 도구도 있습니다. p-curve는 한 주제에서 유의하게 나온(p < .05) 연구들의 p값을 모아 그 분포의 모양을 보는 방법입니다. 참인 효과가 있으면 .04대보다 .01대의 p값이 많은 모양, 곧 '오른쪽으로 기운' 분포가 나옵니다. 효과가 없을 때는 평평하거나 반대로 기웁니다. 그래서 오른쪽으로 기운 p-curve만이 증거가치를 진단하고, 그렇지 않으면 선택적 보고를 유일한 설명으로 배제할 수 없습니다 (PMID 23855496). 선택적 보고는 유의한 연구만 실리는 출판편향(「같은 시험, 다른 결론 — 출판편향과 "무엇을 합쳤는가"」)이나 p-해킹으로 일어납니다.
도구가 믿을 만한지는 효과가 없다고 볼 만한 대상에 걸어 보는 방식으로도 시험합니다. 활성 물질 분자가 단 하나도 들어 있지 않을 가능성이 큰 초고희석 동종요법 제제의 위약대조 시험들에 걸었을 때 이 한 집합에서 p-curve는 증거가치를 정확히 기각했습니다 (PMID 30697492). 운동피질을 자극해 동작 관련 언어 이해를 보는 연구 43편에서는 실제 효과를 탐구한다고 단언할 수 없다는 결과가 나왔고, 추정 검정력(진짜 효과가 있을 때 그것을 잡아낼 확률)도 30% 미만이었습니다 (PMID 36037977).
그런데 이 도구 자체가 논쟁 중입니다. 텍스트마이닝(논문에서 p값을 자동으로 긁어모으는 방식)으로 모은 이질적인 p값 집합에는 적용하기 어렵고, 여러 결과 변수를 재 놓고 유의한 것만 보고하는 형태의 p-해킹은 놓친다는 비판이 있습니다. 시뮬레이션에서 결과 변수들이 서로 상관 없을 때는 .05 바로 아래의 '혹'이 생기지 않았으므로 혹이 없다는 것이 p-해킹이 없다는 뜻은 아닙니다 (PMID 26925335). 파워포즈(당당한 자세가 호르몬을 바꾼다는 주장)와 HPA(스트레스 호르몬 체계) 반응성 논쟁에 적용한 재분석은 어떤 p값을 골라 넣느냐에 따라 결론이 재현되지 않는다며 사용 중단을 권고했습니다 (PMID 38990830). 반대편에는 p-curve가 관찰연구에서도 재현 가능한 발견과 그렇지 않은 발견을 구분해 낸다는 반론이 있고, 두 가지 예시로 이를 보였습니다 (PMID 30856227).
p-해킹이 문헌 전체에 얼마나 퍼져 있는지에 대한 측정도 엇갈립니다. 텍스트마이닝으로 과학 전반을 조사한 연구는 p-해킹이 널리 퍼져 있지만 그 효과는 실제 효과크기에 비해 약해서 메타분석의 합의를 크게 바꾸지는 않는 듯하다고 결론지었습니다 (PMID 25768323). 영상의학 저널 100여 종에서 초록 96만여 편이 검색되었고, 초록마다 p값 하나를 무작위로 뽑은 4,105개를 분석한 결과 p값이 .05 바로 아래 몰리는 현상은 발견되지 않았습니다. 다만 저자들은 이 분석이 모든 형태의 p-해킹을 잡아내지는 못한다고 단서를 답니다 (PMID 36412994). 역학 저널 4종의 초록 21,332편에서는 .05 직하 비중이 2000년 이후 줄었지만, 저자들은 이를 p-해킹 감소라기보다 검정력 증가로 설명하는 편이 자료에 더 맞는다고 보았습니다 (PMID 40838582).
정리하면, 자유도가 존재한다는 것과 그것이 실제 문헌을 얼마나 오염시켰는지는 다른 질문이고, 두 번째 질문은 아직 답이 갈립니다.

앞에서 정해 두는 법 — 사전등록과 등록보고서
밖에서 재는 방법이 이미 나온 결과를 점검한다면, 앞에서 정해 두는 방법은 선택을 결과를 보기 전에 고정합니다. 사전등록은 연구 질문과 분석 계획을 결과를 알기 전에 공개 등록소에 못 박아 두는 일입니다. 기존 관찰로 가설을 만드는 일과 새 관찰로 가설을 검증하는 일은 개념적으로 구분되지만 실무에서는 잘 지켜지지 않고, 사후판단 편향(결과를 알고 나면 처음부터 그럴 줄 알았다고 느끼는 경향) 때문에 연구자 본인도 그 차이를 잘 느끼지 못합니다 (PMID 29531091). 사전등록의 기능은 둘입니다. 결과를 알기 전에 결정을 내리게 해 편향을 줄이고, 남들이 그 위험을 평가할 수 있도록 투명성을 높입니다 (PMID 36707644). 등록보고서는 서론·방법·분석계획을 결과가 나오기 전에 동료심사에 부치고 원칙적 게재 승인을 받는 출판 형식입니다 (PMID 39052343).
그럼 실제로 무엇이 바뀌었을까요. 결과는 엇갈립니다.
사전등록 배지나 상을 받은 심리학 연구 193편과 짝지은 비사전등록 연구 193편을 비교하니, 사전등록 쪽이 양성 결과 비율이 낮지도, 효과크기가 작지도, 통계 오류가 적지도 않았습니다. 저자들의 사전 기대와 어긋나는 결과였습니다. 다만 검정력 분석을 더 자주 했고 표본이 더 컸으며, 저자들은 사전등록이 p-해킹과 HARKing을 막는다는 확실한 증거는 찾지 못했다고 정리했습니다 (PMID 37950113). 사전등록 300건과 대응 논문을 대조한 연구에서 사전등록이 자유도를 다 묶지 못하는 이유의 일부가 보입니다. 사전등록에는 방법적 세부가 자주 빠져 있었고, 계획에서 벗어난 것을 밝히지 않는 일이 잦았으며, 불일치는 주로 자료수집 절차·통계 모형·제외 기준에 몰려 있었습니다 (PMID 39388105).
구조화된 정량연구 템플릿으로 쓴 사전등록 103건과 일반 OSF 양식 52건을 비교한 등록보고서(2단계, 동료심사 완료)에서 전자의 구속력 점수가 유의하게 높았고, 동료심사를 거친 사전등록이 더 높았습니다. 그래도 대응 논문 19개 중 73.68%에 미신고 이탈이 있었습니다 (DOI: 10.1177/25152459261432216). 임상 분야에서 등록보고서로 식별된 무작위대조시험은 드물었고 한 저널군에 집중되어 있었는데, 93편 중 79편(84.9%)이 첫 환자 등록 이후에 프로토콜을 공개했고, 44%에서 주요 결과변수가 바뀌었는데 그 변경을 언급한 것은 그중 33%뿐이었습니다. 저자들은 이 시험들이 등록보고서 형식의 기본 특징을 지키지 않았다고 결론지었습니다 (PMID 37245701). 한 심리학 저널 문헌 전체에 z-curve(유의한 결과들의 분포에서 선택 편향을 추정해 보정하는 방법)를 적용한 프리프린트(동료심사 전)는 위양성 위험을 전체 15%(95% 신뢰구간 6~32%, 「신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법」), 핵심 검정에서는 20%(95% 신뢰구간 7~52%)로 추정했습니다. 이는 앞의 5% 위양성률과는 다른 지표(추정 위양성 위험)입니다. 이 프리프린트는 이른바 신뢰성 혁명 이후 선택 편향이 줄었지만 여전히 강했고, 줄어든 이유는 주로 표본과 검정력 증가였으며 사전등록의 효과는 작았다고 보고했습니다 (DOI: 10.31234/osf.io/6ybeu_v2).
비판도 있습니다. 유용한 도구가 좋은 과학의 지표로 굳으면 그 지표를 얻는 것 자체가 목표가 되어 도구가 왜곡된다는 원리를 캠벨의 법칙이라고 합니다. 이 법칙을 사전등록 배지에 적용한 논평은 배지를 노린 논문들이 이미 규칙과 취지를 어기고 있다고 지적하며 "결과를 안 뒤에 사전등록하기"라는 새 관행을 경고했습니다 (PMID 38783515). 반대편에서는 독성학 맥락의 검토가 몇몇 비판은 오해에서 나왔고 비판 전반에 실증 근거가 부족하다고 보면서도, 사전등록 여부가 품질의 대용 지표로 쓰이는 위험은 타당한 우려로 인정했습니다(동료심사 전 프리프린트) (DOI: 10.31234/osf.io/dqap7).
정직한 미해결
자유도는 완전히 없애기 어렵습니다. 탐색적 분석 자체는 나쁘지 않습니다. 문제는 탐색을 확증인 것처럼 제시하는 데 있고, 무엇이 적절한지는 의도와 투명성에 달려 있습니다 (PMID 34780242). 가정 위반에 강한 추정법으로 바꿔도 어떤 방법을 언제 쓸지가 다시 자유도가 되므로, 민감도 분석(분석 선택을 바꿔도 결과가 유지되는지 보는 분석)까지 사전등록하자는 제안이 나옵니다 (PMID 41048396).
반복 검증 쪽에도 같은 자유도가 있습니다. 한 논쟁의 자료를 다시 분석한 연구는, 반복 실험자의 유연성이 엄격한 기준을 지키는 것처럼 보이면서도 "재현 실패"를 만들어 낼 수 있고 이 문제가 사전등록으로 충분히 해결되지 않는다고 지적합니다 (PMID 31767750).
여러 요인과 연관됩니다. 연구자 3,050명 조사에서 출판 압력(β = 0.12)과 명성·자존 동기는 문제적 관행 관여와 양의 연관을, 과학 규범에 대한 헌신과 이론을 반증하려는 동기는 음의 연관을 보였습니다. β는 연관의 방향과 세기를 나타내는 계수이고, 응답자는 초대받은 사람 중 응한 일부이며 주로 유럽과 미국 연구자였습니다 (PMID 42469920). 계약 형태와 경력 단계가 예측 변수이고 기관·국가 간 분산은 미미하다는 다수준 분석도 있습니다 (PMID 39397013).
논문에서 확인할 다섯 가지
논문을 읽을 때 위험 신호는 대체로 다섯 자리에서 드러납니다.
- 분석 계획이 데이터를 보기 전에 등록되었는지, 그리고 등록본과 논문이 실제로 일치하는지가 첫째입니다. 등록되어 있다는 것만으로는 부족합니다. 미신고 이탈이 잦았으므로 등록본과 논문이 일치하는지도 중요합니다 (PMID 39388105, DOI: 10.1177/25152459261432216).
- 제외 기준·이상치 처리·공변량 선택이 명시되어 있는지가 둘째입니다. 이 세 자리는 선택에 따라 결과가 달라진 사례가 보고된 곳입니다 (PMID 31841112, PMID 37691812, PMID 31568872).
- 결과가 명세 선택에 얼마나 민감한지가 셋째입니다. 민감도 분석이나 멀티버스가 붙어 있고 흔들리는 양과 안 흔들리는 양이 구분되어 있으면 좋은 신호입니다 (PMID 32719546, DOI: 10.2139/ssrn.7008242).
- 보고된 결과가 잰 것의 전부인지 고른 것인지가 넷째입니다. 설문을 정리한 연구에서는 정보를 빼는 관행이 더하거나 바꾸는 관행보다 더 흔히 보고되었습니다 (PMID 41963575).
- 가설이 데이터를 보기 전의 것인지가 다섯째입니다. 사후 가설을 사전 가설처럼 제시하면 결과의 신뢰도가 떨어집니다 (PMID 29531091, PMID 15647155).
위 항목들은 하나하나로는 정당한 판단일 수 있습니다. 다만 결과를 본 뒤에 내려지는 선택에는 출판 압력이나 명성 동기가 얹힐 수 있다는 조사도 있습니다 (PMID 42469920). 73개 팀 연구에서는 전문성과 사전 신념으로 팀 사이 차이가 거의 설명되지 않았고, 저자들은 단일 연구의 결과를 말할 때 더 겸손하고 분명하게 보고해야 한다고 결론지었습니다. 결과를 보기 전에 선택을 정해 두는 방법과 가능한 선택을 전부 돌려 펼쳐 보이는 방법이 지금의 대응이고, 어느 쪽도 아직 완전하지 않다는 것까지가 지금의 정직한 상태입니다.
근거 논문
- "Questionable Research Practices: A Principled Classification and Ranking Based on Survey Data" (2026) — PMID 41963575 — 설문 정의를 체계적으로 모아 분류·순위화. 가장 흔한 항목은 분석·인용·공변량 선택, 가장 드문 축이 조작·날조·표절. 정보의 '빼기'가 '더하기·바꾸기'보다 흔함.
- "False-positive psychology: undisclosed flexibility in data collection and analysis allows presenting anything as significant" (2011) — PMID 22006061 — 연구자 자유도 개념의 출발점. 시뮬레이션과 실제 실험 2건, 저자용 6요건·심사자용 4지침 제안.
- "Measuring the prevalence of questionable research practices with incentives for truth telling" (2012) — PMID 22508865 — 심리학자 2,000명 이상, 진실 보고 유인 결합. 일부 관행이 사실상 표준 규범일 가능성.
- "Prevalence of questionable research practices, research misconduct and their potential explanatory factors" (2022) — PMID 35171921 — 네덜란드 연구자 6,813명. 51.3%가 최소 한 가지 관행에 자주 관여, 날조 4.3%·변조 4.2%, 출판 압력 OR 1.22.
- "Degrees of Freedom in Planning, Running, Analyzing, and Reporting Psychological Studies: A Checklist to Avoid p-Hacking" (2016) — PMID 27933012 — 전 과정의 자유도 34개 목록. 교육·사전등록 품질 평가용 체크리스트.
- "The hazards of dealing with response time outliers" (2023) — PMID 37691812 — 이상치 처리법 선택이 p값을 부풀리고 신뢰구간·효과크기를 왜곡. 대안(베이즈·두꺼운 꼬리)도 또 다른 유연성을 연다.
- "Navigating the garden of forking paths for data exclusions in fear conditioning research" (2019) — PMID 31841112 — 비학습자·무반응자 제외 기준의 이질성과 재분석 사례. 합의 기준 제안.
- "The quandary of covarying" (2020) — PMID 31568872 — 구조 뇌영상 2년치에서 공변량 0~14개, 68개 모델에 37가지 조합. 공개 데이터 검증에서 조합에 따라 결과 양상이 뒤집힘.
- "Researcher degrees of freedom in statistical software contribute to unreliable results" (2023) — PMID 35953660 — SPSS·SAS·Stata·R 비교. 2×2 카이제곱에서 패키지 간 p값 차 .005~.162.
- "Garden of forking paths in ERP research" (2024) — PMID 38961523 — 문헌 기반 14개 파이프라인을 같은 N400 데이터에 적용. 저역통과 필터만 결과에 영향을 주지 않음.
- "HARKing: hypothesizing after the results are known" (1998) — PMID 15647155 — 사후 가설을 사전 가설로 제시하는 관행의 정의·유형·억제책.
- "Researcher degrees of freedom in phonetic research" (2018) — DOI: 10.31234/osf.io/fp4jr — 1종 오류 시뮬레이션으로 위양성 팽창 시연(동료심사 전 프리프린트).
- "The Garden of Forking Paths: … in Cyclostratigraphic Analysis" (2019) — DOI: 10.1002/essoar.10500564.1 — 주기 탐지 성공률 100%를 확증 편향의 징후로 지목. 다중검정 미보정과 데이터 의존적 절차 변경(동료심사 전 프리프린트).
- "Big little lies: a compendium and simulation of p-hacking strategies" (2023) — PMID 36778954 — p-해킹 전략 12종 목록과 위양성률 시뮬레이션, 대책의 전략별 평가.
- "Observing many researchers using the same data and hypothesis reveals a hidden universe of uncertainty" (2022) — PMID 36306328 — 연구자 161명·73개 팀. 결정을 모두 코딩해도 분산의 95% 이상이 미설명.
- "Meta-analyzing the multiverse: A peek under the hood of selective reporting" (2025) — PMID 37166859 — 등록 반복 연구 294편의 반사실적 재구성. 가설 방향 유의 효과는 약 30%의 연구뿐, 자유도 효과가 표본 간 비일관.
- "Specification curve analysis" (2020) — PMID 32719546 — 명세 식별·시각화·결합 추론 3단계. 세 발견에 적용해 견고/약함/비견고를 구분.
- "Grilling the data: application of specification curve analysis to red meat and all-cause mortality" (2024) — PMID 38354868 — 문헌에서 뽑은 70개 방법으로 1,208개 명세. 유의 48개(3.97%) 중 40개가 사망률 감소 방향.
- "Using electrodermal activity to estimate fear learning differences in anxiety: A multiverse analysis" (2024) — PMID 39142133 — 1,240개 분석 중 1.45%만 이론 부합 유의.
- "A multiverse meta-analysis of oxytocin administration studies" (2025) — PMID 40848964 — 185편·530개 효과크기로 256개 메타분석. d = -0.16~1.45, 다만 90% 이상이 영효과 부트스트랩 범위를 초과.
- "The Systematic Multiverse Analysis Registration Tool for defining multiverse analyses" (2025) — PMID 41164340 — 멀티버스 구성 자체의 결정과 근거를 단계별로 문서화하는 등록 도구.
- "From Logs to Metrics: The Impact of Researcher Degrees of Freedom on Smartphone Usage Metrics" (2026) — DOI: 10.2139/ssrn.7008242 — 16,128개 명세. 절대값은 최대 3배 차이, 개인 간 순위는 안정(평균 스피어만 .87~.93)(동료심사 전 작업논문).
- "P-curve: a key to the file-drawer" (2014) — PMID 23855496 — 유의한 p값 분포의 오른쪽 치우침으로 증거가치를 판정하는 방법.
- "P-curve accurately rejects evidence for homeopathic ultramolecular dilutions" (2019) — PMID 30697492 — 존재하지 않는다고 볼 만한 효과에 적용해 정확히 기각.
- "Does the involvement of motor cortex in embodied language comprehension stand on solid ground?" (2022) — PMID 36037977 — 43편 p-curve와 과잉유의 검정. 추정 검정력 30% 미만.
- "Problems in using p-curve analysis and text-mining to detect rate of p-hacking and evidential value" (2016) — PMID 26925335 — 유령 변수형 p-해킹은 '혹'을 만들지 않아 놓친다. 혹의 부재는 p-해킹 부재의 증거가 아님.
- "The inconsistency of p-curve: Testing its reliability using the power pose and HPA debates" (2024) — PMID 38990830 — p값 선택 순열에 따라 결론이 재현되지 않음. 사용 중단 권고.
- "P-curve won't do your laundry, but it will distinguish replicable from non-replicable findings in observational research" (2019) — PMID 30856227 — 관찰연구 적용 가능성 옹호 반론.
- "The extent and consequences of p-hacking in science" (2015) — PMID 25768323 — 텍스트마이닝으로 광범위 확인. 다만 효과는 실제 효과크기 대비 약해 메타분석 합의를 크게 바꾸진 않는 듯.
- "Is There Evidence of P-Hacking in Imaging Research?" (2023) — PMID 36412994 — 초록 967,981편·p값 293,687개. .05 직하 집중 없음. 다른 형태의 편향은 배제 못 함.
- "Trends in the distribution of P values in epidemiology journals" (2025) — PMID 40838582 — 초록 21,332편. .05 직하 감소는 p-해킹 감소보다 검정력 증가로 더 잘 설명됨.
- "The preregistration revolution" (2018) — PMID 29531091 — 가설 생성과 검증의 혼동, 사후판단 편향, 사전등록의 논리와 실무 전략.
- "Reducing bias, increasing transparency and calibrating confidence with preregistration" (2023) — PMID 36707644 — 사전등록의 두 기능(편향 감소·투명성)과 메타연구 정리.
- "Want to try a registered report? Here are our lessons learned" (2024) — PMID 39052343 — 등록보고서 형식 개요와 실무 교훈 8가지.
- "Preregistration in practice: A comparison of preregistered and non-preregistered studies in psychology" (2024) — PMID 37950113 — 193 대 193 비교. 양성 결과·효과크기·통계 오류에서 차이 없음, 검정력 분석·표본 크기·영향력에서는 우위.
- "The potential of preregistration in psychology: Assessing preregistration producibility and preregistration-study consistency" (2024) — PMID 39388105 — 사전등록 300건 대조. 세부 누락과 미신고 이탈이 빈번, 불일치는 자료수집·통계모형·제외기준에 집중.
- "Stage 2 Registered Report: Restriction of Researcher Degrees of Freedom Through the Psychological Research Preregistration-Quantitative Template" (2026) — DOI: 10.1177/25152459261432216 — 구조화 템플릿 103건 대 OSF 양식 52건. 구속력 유의하게 높고 동료심사 거친 쪽이 더 높음. 그럼에도 대응 논문 19개 중 73.68%에 미신고 이탈.
- "Published registered reports are rare, limited to one journal group, and inadequate for randomized controlled trials in the clinical field" (2023) — PMID 37245701 — RCT 93편. 84.9%가 첫 환자 등록 후 프로토콜 공개, 44%가 주요 결과변수 변경, 그중 33%만 언급.
- "False Positive Psychology? An Empirical Investigation of the False Positive Risk … Before and After the Credibility Revolution" (2025) — DOI: 10.31234/osf.io/6ybeu_v2 — z-curve 추정 위양성 위험 전체 15%(6~32%), 핵심 검정 20%(7~52%). 사전등록 효과는 작음(동료심사 전 프리프린트).
- "Campbell's Law Explains the Replication Crisis: Pre-Registration Badges Are History Repeating" (2025) — PMID 38783515 — 지표가 목표가 되면 도구가 왜곡된다는 논변. '결과를 안 뒤 사전등록하기' 경고.
- "The Benefits of Preregistration and Registered Reports" (2024) — DOI: 10.31234/osf.io/dqap7 — 비판 대부분이 개념 혼동 또는 실증 근거 부재라는 반론(동료심사 전 프리프린트).
- "Understanding the exploratory/confirmatory data analysis continuum" (2022) — PMID 34780242 — 탐색·확증·'거친 확증'의 구분과 p-해킹·HARKing과의 윤리적 경계.
- "Robust statistical methods and the credibility movement of psychological science" (2025) — PMID 41048396 — 가정 위반 대응이 다시 자유도가 되므로 민감도 분석까지 사전등록하자는 제안.
- "Replicator degrees of freedom allow publication of misleading failures to replicate" (2019) — PMID 31767750 — 반복 검증 쪽 유연성이 위음성 재현 실패를 만들 수 있으며 사전등록으로 충분히 해결되지 않음.
- "Why researchers cut corners: motivations, pressures, and personality in questionable research practices" (2026) — PMID 42469920 — 연구자 3,050명. 출판 압력 β = 0.12, 명성·자존 동기 양의 연관, 과학 규범 헌신·반증 동기 음의 연관.
- "Investigating the links between questionable research practices, scientific norms and organisational culture" (2024) — PMID 39397013 — 계약 형태·경력 단계·규범 준수가 예측 변수. 기관·국가 간 분산은 미미.
🏛️ 이 글의 뿌리가 된 논문
이 글이 근거로 삼은 논문 중 ‘거인의 어깨’에 오른 초석 연구예요. 개념을 익혔다면 원전으로 가보세요.
연구자의 평범한 재량만으로도 위양성률이 급등함을 보여 사전등록 관행의 초석을 마련했습니다.
이 분야의 거인의 어깨 →같은 데이터와 가설이라도 분석하는 팀에 따라 결론이 크게 달라진다는 사실을 실증했습니다.
이 분야의 거인의 어깨 →