Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

사라지는 효과 — 교과서에 실렸던 발견들은 왜 다시 재면 작아지는가

자아고갈, 성장 마인드셋, 암묵편향 검사 — 다시 재면 작아진 효과를 「틀렸다」와 「없다」로 줄이지 않고 읽는 법

🔥논쟁✦AI 생성심리·사회과학 · 2026년 10월 10일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

사라지는 효과 — 교과서에 실렸던 발견들은 왜 다시 재면 작아지는가

왜 이 논쟁인가

2015년 재현성 프로젝트(심리학 실험을 대규모로 다시 해 본 프로젝트)의 널리 알려진 숫자는 "100편 중 36편만 유의했다"입니다. 통계적으로 유의하다는 것은 우연만으로는 이만큼의 차이가 나오기 어렵다는 기준을 통과했다는 뜻입니다(「「통계적으로 유의했다」는 무엇을 말하나 — 동전 던지기로 읽는 p값」). 같은 논문에는 크기에 관한 문장이 하나 더 있습니다. 재현에서 나온 효과크기가 원래 효과크기의 절반이었습니다 (PMID 26315443). 효과크기는 차이가 얼마나 큰지를 잰 값입니다. 유의성은 문턱을 넘었느냐의 문제이고, 절반은 크기의 문제입니다.

첫 편 「심리학의 재현 위기 — 우리가 믿었던 발견들은 왜 흔들렸나」가 그 사건을, 둘째 편 「연구자 자유도와 p-해킹 — 조작 없이도 원하는 결과가 나오는 법」이 분석 재량의 문제를 다뤘습니다. 이 편의 질문은 이것입니다. 다시 쟀더니 효과가 나오긴 나오는데 훨씬 작다면, 그건 무슨 뜻일까요.

이 편이 따라가는 사례는 셋입니다. 자아고갈은 자제력이 쓸수록 바닥난다는 이론이고, 성장 마인드셋은 능력이 노력으로 자란다고 믿게 하면 성적이 오른다는 주장이며, 암묵편향 검사(IAT)는 본인도 모르게 가진 연상을 잰다는 검사입니다. 재검증에서 자아고갈과 마인드셋은 효과가 작아졌고, IAT는 예측력을 두고 논쟁이 이어졌습니다. 가장 쉬운 해석은 "원저자가 틀렸다"입니다. 이 글은 그 해석을 쓰지 않습니다. 부정직이 없어도 작동하는 기계장치가 축소에 큰 몫을 하고, 그 기계는 정직한 연구자에게도 똑같이 작동합니다.

통념, 그리고 그 반대편의 통념

재현이 안 됐다는 소식에는 서로 마주 보는 통념 두 개가 따라붙습니다. 하나는 재현 실패가 원래 발견이 거짓이었다는 뜻이라는 통념입니다. 다른 하나는 조건이 달라서 생긴 일일 뿐이니 숨은 조절변수, 곧 효과의 크기를 바꾸는 조건을 찾으면 된다는 통념입니다. 둘 다 편리하고, 둘 다 세 번째 답을 지웁니다. 원래 보고된 효과크기가 애초에 참값, 곧 현실에서 그 효과가 실제로 갖는 크기가 아니었을 가능성입니다.

기계장치 — 검정력, 승자의 저주, 문턱

축소를 만드는 톱니는 넷입니다.

첫째 톱니, 검정력이 낮습니다. 검정력은 참인 효과가 실제로 있을 때 그것을 유의한 결과로 잡아낼 확률입니다. 200개 심리학 메타분석 영역의 효과크기 12,065개를 훑은 조사에서 영역별 중위 검정력은 약 36%였고, 관례상 충분하다는 80%를 넘는 연구는 8%뿐이었습니다 (PMID 30321017). 신경과학의 한 고전적 추정은 21%였습니다 (PMID 23571845; 수치는 PMID 28706080에 인용). 다만 그 추정을 재분석한 연구는 하위 분야마다 편차가 커서 단일 요약값으로는 부족하며 저검정력이 보편적 문제는 아니라고 봅니다 (PMID 28706080). 의학에서도 비슷합니다. 코크런 데이터베이스에서 모은 효과 추정치와 표준오차 23,551쌍으로 재구성한 중위 달성 검정력은 13%였습니다 (PMID 34425632).

둘째 톱니, 낮은 검정력은 실패만 낳지 않고 과장을 낳습니다. 검정력이 낮으면 참인 효과를 놓치는 일이 잦아집니다. 여기까지는 당연합니다. 덜 당연한 점은 그 와중에 운 좋게 유의해진 연구의 추정치는 참값보다 큰 경향이 있다는 것입니다. 작은 표본은 우연의 흔들림이 커서, 문턱을 넘으려면 우연이 같은 방향으로 크게 도와야 하기 때문입니다. 문턱을 넘어야 눈에 띄는 세계에서는 처음 눈에 띄는 값이 큰 경향이 있습니다. 이렇게 문턱을 넘은 결과가 참값보다 부풀어 보이는 현상을 승자의 저주라고 부릅니다. 유전학 문헌에서는 처음 보고된 효과가 후속 연구보다 과장돼 있는 경우가 많고, 그 과장이 후속 연구를 검정력이 낮게 설계되게 해 실패하게 만들 수 있다고 설명합니다 (PMID 19140131, PMID 18703928).

개념도. 가로축은 연구가 잰 효과크기 추정치. 참값에 중심을 둔 종 모양 분포가 있고, 참값보다 오른쪽에 유의 문턱 점선이 있다. 문턱 왼쪽은 회색(눈에 띄지 않는 쪽), 오른쪽은 파란색(눈에 띄는 쪽)으로 칠했다. 파란 부분의 평균을 뜻하는 선이 참값 선보다 오른쪽에 있고, 두 선 사이에 참값보다 크다는 표시가 있다. 모양과 위치는 예시이며 수치는 없다.

정량형질 유전체 연관 연구 332편 중 재현 시도의 표본 크기를 좌위(유전체 위의 위치)별로 정확히 보고한 39건·707좌위에서는 승자의 저주를 보정해 예측한 재현 수(458개)가 실제 재현(457개)과 맞았습니다. 그 밖의 연구는 보정 후에도 기대보다 덜 재현됐고, 조상 집단이 다른 연구에서는 더 덜 재현됐습니다 (PMID 28715421). 이 코크런 자료를 분석한 논문은 같은 과장을 과장비라고 부릅니다. 5% 수준에서 겨우 유의한 추정치는 참값을 1.7배 과대추정할 것으로 기대됩니다 (PMID 34425632).

셋째 톱니, 문턱은 유의성만이 아닙니다. 예측변수 네 개와 그 이원 상호작용(두 변수가 함께 작용하는 항)으로 회귀 모형을 시작해 유의하지 않은 항을 지워 나가면, 모든 귀무가설이 참이어도, 곧 진짜로 아무 효과가 없어도 최소 하나가 유의할 확률이 40%입니다 (PMID 21297852). 연구자가 뇌영상의 복셀(측정 지점)뿐 아니라 자극, 과제 설정, 결과를 재는 변수까지 효과가 가장 잘 보이는 쪽으로 고른다는 지적도 있습니다 (PMID 26162135). 학술지도 문턱입니다. 보건경제 문헌에서는 영향력이 높은 학술지일수록 더 큰 추정치를 실었습니다 (PMID 23182564).

넷째 톱니, 출판편향이 그 위에 얹힙니다. 유의한 결과가 더 잘 출판되는 쏠림인 출판편향은 「같은 시험, 다른 결론 — 출판편향과 "무엇을 합쳤는가"」에서 다뤘습니다. 효과크기는 흔히 d로 적습니다. d는 두 집단 평균의 차이를 데이터의 흩어진 정도로 나눈 값이라, 0이면 차이가 없고 클수록 차이가 큽니다. 메타분석, 곧 여러 연구를 모아 하나로 합친 분석(「메타분석은 평균을 내지 않는다 — 숲그림의 마름모가 만들어지는 법」) 68,000여 건(대부분 의학, 심리학은 605건)을 훑은 조사에서 선택편향을 보정하자 중위 효과크기가 심리학은 d 0.37→0.26, 경제학은 0.20→0.07, 의학은 0.24→0.13으로 내려갔습니다 (PMID 38327122). 유의성을 모으는 것이 게임의 규칙이라면, 작은 표본 여러 개를 굴리는 편이 큰 표본 하나보다 효율적인 전략이라는 시뮬레이션도 있습니다 (PMID 26168111). 일찍 끝낸 임상시험, 곧 중간 분석에서 이득이 보여 도중에 멈춘 시험을 모사한 시뮬레이션에서는 전형적인 조기종료 시험의 경우 치료가 위험을 줄인 비율(상대위험감소)의 참값이 관측값의 3분의 2였고, 큰 시험(SPRINT형)에서는 과대추정이 훨씬 작았습니다 (PMID 36064448). 같은 계열의 결과입니다.

이 톱니 중 어느 것도 부정직을 요구하지 않습니다.

성적표 ① 자아고갈 — 대규모 재현에서는 거의 0

2010년 메타분석은 83편을 묶어 자아고갈 효과, 곧 자제력을 한 번 쓰면 바로 이어지는 과제에서 자제력이 떨어지는 현상이 유의하다고 보고했고, 저자들 스스로 이 결과가 강도 모형(자제력은 쓰면 줄어드는 자원이라는 모형)에 "예비적 지지"를 준다고 적었습니다 (PMID 20565167). 그다음이 문제였습니다.

사전등록, 곧 연구 전에 가설과 분석 계획을 공개해 두고 같은 절차로 여러 실험실이 되풀이한 재현에서 효과크기는 0 가까이로 내려갔습니다. 23개 실험실의 재현(N=2,141)에서 d = 0.04였고, 95% 신뢰구간 [−0.07, 0.15]이 0을 포함했습니다 (PMID 27474142). 신뢰구간(「신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법」)이 0을 포함한다는 것은 효과가 없는 경우도 이 데이터와 어긋나지 않는다는 뜻입니다. 다른 과제 조합으로 한 12개 실험실 재현(N=1,775)은 작지만 유의한 d = 0.10이었고, 무작위로 응답했을 가능성이 있는 참가자를 뺀 분석에서는 0.16이었습니다 (PMID 34113424). 36개 실험실 다중현장 검증(N=3,531)에서 사전에 정한 확증 분석은 d = 0.06으로 유의하지 않았습니다. 베이즈 분석, 곧 두 가설 중 데이터가 어느 쪽에서 몇 배 더 그럴듯한지 비교하는 분석은 "효과 있음" 가설보다 "효과 없음" 가설에서 4배 더 그럴듯하다고 판정했습니다. 다만 배제 기준을 적용하지 않은 전체 표본의 탐색 분석에서는 d = 0.08로 유의했고, 이때 베이즈 분석은 두 가설에서 데이터가 거의 같은 정도로 그럴듯하다고 봤습니다 (PMID 34520296). 세 대규모 검증의 효과크기는 0에서 작은 양수 사이에 놓였습니다. 12개 실험실 재현의 d = 0.10(제외 후 0.16)과 36개 실험실 탐색 분석의 유의한 d = 0.08은 0이 아니라 작은 양수입니다. 제목의 "거의 0"은 이 범위를 줄인 말입니다.

세 연구를 각각 한 줄로 놓고 같은 d 눈금(−0.2~0.3)에 점으로 찍은 그림. 23개 실험실 재현(N=2,141): d=0.04, 95% 신뢰구간 −0.07~0.15로 0을 포함. 12개 실험실 재현(N=1,775): d=0.10(작지만 유의), 무작위 응답 의심 참가자를 뺀 분석 0.16. 36개 실험실 검증(N=3,531): 사전 확증 분석 d=0.06(유의하지 않음), 배제 기준을 적용하지 않은 탐색 분석 0.08(유의). 설계가 달라 순위가 아니며 신뢰구간은 23개 실험실 재현에만 있다.

하위 가설은 더 약했습니다. 의지력이 포도당을 연료로 쓴다는 혈당 모형은 세 가지 따름명제를 냅니다. 자제력을 쓰면 혈당이 줄고, 남은 혈당이 이어지는 수행과 함께 움직이며, 포도당을 먹으면 자제력이 회복된다는 것입니다. 메타분석에서 세 가지 모두 지지되지 않았습니다. 포도당을 삼키지 않고 입만 헹구는 효과는 유의했지만 출판편향 징후가 뚜렷했습니다 (PMID 27492453). p-곡선 분석(유의한 결과들의 p값 분포로 증거의 질을 살피는 방법)에서는 증거가치가 약하다고 판정됐고 (PMID 27485134), 70명·115명 두 실험에서도 설탕 음료가 고갈을 상쇄하지 못했습니다 (PMID 24389240). 의지력 신념이 고갈을 조절한다는 가설(원 표본 60명)도 187명 재현에서 살아남지 못했습니다 (PMID 37384732).

반론도 실어야 공정합니다. 앞선 메타분석이 쓴 편향 보정 기법(PET-PEESE)을 부적절하게 적용했다고 지적하며 효과를 다시 잰 재-메타분석이 있습니다. 그 초록은 어떤 고갈 과제가 효과적인지의 차이를 보고하며 전체 효과크기는 제시하지 않습니다 (PMID 28391367). 다만 세 가지 프로토콜·840명을 모은 연구는 베이즈 분석에서 귀무가설을 강하게 지지했습니다 (PMID 29314092). 초대받은 1,721명 중 응답한 277명의 익명 설문에서는 37.7%가 문제적 연구 관행을 스스로 사용했다고 답했습니다 (PMID 29940020).

인접 문헌에서는 방향이 갈렸습니다. 인지적 소모가 신체 수행을 떨어뜨린다는 73편·2,581명 메타분석은 g = −0.38(d와 같은 종류의 표준화된 차이)을 보고했고, 저자들은 이 효과가 우연으로는 설명되지 않으며 이전 메타분석이 효과를 과소추정했을 수 있다고 봅니다 (PMID 31873926). 정신적 피로와 운동 수행을 따로 본 분석은 출판편향을 보정하면 효과가 대부분의 방법에서 무시할 수준이 됐지만, 가장 낙관적인 시나리오에서는 −0.36이 남았고 베이즈 분석은 효과의 유무를 가리지 못했습니다 (PMID 37682411).

성적표 ② 성장 마인드셋 — 작고 조건부

성장 마인드셋 개입은 능력이 노력으로 자란다는 믿음을 학생에게 가르쳐 성적을 올리려는 프로그램입니다. 한 시간도 안 되는 온라인 개입이 저성취 학생의 성적을 올리고 상급 수학 과목 등록을 늘렸다는 것이 미국 전국 대표 표본 실험의 보고입니다 (PMID 31391586). 저성취 학생의 성적은 GPA(평점) 0.10점 올랐다고 보고됐고 (후속 논평, PMID 31494041), 성적이 바뀐 것은 또래 규범이 개입 메시지와 맞는 학교에서였습니다 (PMID 31391586).

2023년 메타분석은 53개 독립 표본을 묶어, 효과가 가장 기대되는 하위표본이면서 실행 충실도가 높은 조건으로 좁혔을 때 학업 성취 d = 0.14 (95% CI [.06, .22]), 정신건강 d = 0.32였습니다. 학업 성취의 예측구간은 −0.08에서 0.35였습니다 (PMID 36227318). 예측구간은 앞으로 나올 개입 연구가 낼 만한 효과의 범위이며, 0 아래에서 시작한다는 것은 연구에 따라 효과가 0에 못 미칠 수도 있다는 뜻입니다.

교사가 직접 전달한 개입도 성적이 위태로운 학생의 성적을 0.27 표준편차 올렸다고 보고됐습니다(6~7학년 1,996명, 교사 50명, 무작위 시험). 이 설계는 지지적 학급 환경을 함께 만들도록 짜였고, 효과는 사전에 고정 마인드셋을 지지한 교사의 학생에게서 가장 컸습니다 (PMID 35699476). 척도가 달라 앞의 0.10점과 직접 비교할 수는 없습니다. 다른 설계인 온라인 개입의 전국 연구 자료를 교사 변수로 다시 분석하자, 학생의 마인드셋 효과가 유지되려면 교사 자신의 성장 마인드셋이 받쳐 줘야 한다는 가설이 지지됐습니다 (PMID 34936529). 온라인 개입은 교실 환경을 바꾸지 않으므로 교사가 이미 지지적인 곳에서 효과가 유지되고, 교사 전달형은 지지적 환경 자체를 만들도록 설계됐다는 점에서 두 결과가 어긋나지 않습니다. 같은 계열의 추적 조사에서는 개입 효과가 아니라 관찰된 연관으로, 고등학교 첫 학년 초의 마인드셋 신념이 몇 년 뒤 대학 등록을 예측했고, 교사의 지지가 이를 조절했다는 증거가 일부 있었으며, 팬데믹 이후에는 예측력이 약해졌습니다 (PMID 39073263). 보건계열 학생 대상 메타분석(비무작위 시험 포함)에서는 포함 연구가 2편뿐이었고, 마인드셋 점수를 올리는 개입 효과의 통합값이 표준화 평균차(SMD) 0.25, 95% CI [−0.18, 0.68]였습니다. 저자들은 예비 증거로서 이득이 있을 수 있다고 보지만, 연구가 2편뿐이라 0도 배제되지 않습니다 (PMID 38600797).

마인드셋 이론을 제안한 드웩(Dweck)과 예이거(Yeager)의 회고는 마인드셋 연구가 현장 실험과 재현 과학의 시대로 넘어갔다고 서술하고, 배울 것이 훨씬 많다고 결론짓습니다 (PMID 30707853). 교육학 일반의 관행도 문제입니다. 교육학 주요 학술지 두 곳에 최근 5년 동안 실린 메타분석에서 출판편향 보정은 대체로 생략됐고(마인드셋 메타분석에 한정한 조사는 아닙니다, PMID 34081730), 보정을 생략하면 효과크기 추정치가 얼마나 부풀었는지 알 수 없습니다. 중국 표본 59편(54,302명)의 상관 메타분석은 마인드셋과 정신건강 지표 사이에 r = 0.36 / −0.25를 보고하지만 (PMID 39504841), 상관은 개입의 효과와 다른 질문에 답합니다.

성적표 ③ 암묵편향 검사 — 0이 아니라 "무엇을 재는가"

암묵편향 검사(IAT)는 범주(예: 인종 집단)와 평가 단어를 얼마나 빠르게 짝지을 수 있는지로 본인도 모르게 가진 연상을 재는 검사입니다. 쟁점은 이 점수가 실제 행동을 예측하느냐입니다. 예측력은 두 값이 함께 움직이는 정도인 상관계수 r로 적고, 예측하려는 행동이나 판단을 준거라고 부릅니다.

2009년 메타분석은 122개 보고·14,900명에서 IAT의 평균 예측 상관을 r = .274로 잡았고, 흑백 간 상호작용 행동을 준거로 한 32개 표본에서는 IAT가 자기보고보다 더 잘 예측했다고 보고했습니다 (PMID 19586237). 같은 해 다른 팀은 자주 인용되던 두 연구의 자료를 다시 분석해, IAT 점수를 회귀 모형에 넣어도 예측 오차는 아주 조금만 줄고 개인 수준 행동은 예측되지 않는다고 적었습니다 (PMID 19449998).

2013년 메타분석에서 IAT는 뇌활동을 빼면 어떤 차별 준거 범주에서도 좋은 예측자가 아니었고 간단한 자기보고보다 나을 것도 없었습니다 (PMID 23773046). 2016년 재분석은 준거 쪽을 의심했습니다. 그 문헌에서 "차별"로 불린 결과 변수 상당수가 실제로는 뇌활동이나 투표 선호였고, 진짜 차별만 남기자 전체 효과는 0에 가깝고 연구마다 크게 엇갈렸습니다 (PMID 27109866). 그 저자들은 IAT가 차별을 예측한다는 가정에 기댄 실제 적용에는 강하게 반대하면서도, 태도·편견·고정관념에 관심 있는 연구자·교육자 등에게는 도구로서 쓸모가 있다고 적었습니다.

그다음이 흥미롭습니다. 2019년의 최대 메타분석은 217개 보고·36,071명을 묶었습니다(이전 메타분석은 3,471명과 5,433명이었습니다). 구조방정식 분석에서 암묵 측정은 β = .14의 고유 기여, 곧 자기보고를 고려한 뒤에도 남는 몫을 보였습니다. 이질성은 매우 컸습니다. 이질성은 연구마다 효과가 크게 다르다는 뜻이고(「I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법」), 연구 목적이 상관에 있고, 표준 IAT를 쓰고, 속성 극성이 높고, 행동을 상대적으로 재고, 검사와 행동이 잘 대응하는 다섯 방법 특성이 모두 맞아떨어진 연구 13편의 평균 상관은 r = .37, 모두 낮은 연구 6편에서는 r = .02였습니다(217편 중 일부이며 품질 판정이 아닙니다). 저자들은 대부분의 연구가 검정력이 크게 부족했다고도 지적합니다 (PMID 30550298). 방법 조건에 따라 상관이 이렇게 갈리므로 질문은 "효과가 있느냐"보다 "어떤 조건에서 무엇을 재느냐"가 됩니다. 20년을 돌아본 리뷰는 예측력이 약하고 자기보고 위에서 더해 주는 설명력(증분타당도)은 무시할 만하다고 결론지으면서도, 그 이유와 개선 방향을 제시하고 IAT에 큰 잠재력이 있다고 덧붙입니다 (PMID 31787912).

IAT를 개발한 그린왈드(Greenwald) 등이 쓴 반론도 있습니다. 흑백 태도·고정관념 IAT를 본 2009년 메타분석(r = .236)과 2013년 메타분석(r = .148)의 차이는 대부분 어떤 효과크기를 포함할지 정하는 포함 정책의 차이였고, 어느 쪽 수치를 쓰든 사회적으로 유의미한 차별 영향을 설명하기에는 충분히 크다는 것입니다 (PMID 25402677). 머리카락 질감이라는 표현형에 맞춘 IAT는 인종태도 IAT와 자기보고 위에서 법적 판단 지지를 추가로 예측했습니다 (PMID 34487286). 반대 극단에는 다중방법 자료의 구조방정식 모형에서 IAT가 암묵 구성개념을 잰다는 증거를 찾지 못했다는 주장이 있습니다 (PMID 33709849).

측정 신뢰도, 곧 같은 사람이 같은 검사를 다시 받을 때 비슷한 점수가 나오는 정도도 남는 문제입니다. 6~11세 519명 연구의 재검사 신뢰도는 .34~.48이었습니다 (PMID 29251966). 의료진·의대생 29개 연구 메타분석의 통합 IAT 점수(예측력이 아니라 집단 평균 점수)는 의사 0.28, 의대생 0.35(95% CI 0.03~0.67)였고, 저자들은 의사·의대생에게 반흑인 암묵 태도가 있었고 그 크기는 작았다고 결론짓습니다 (PMID 34495481).

성적표 ④ — 사라진 것, 조건으로 살아난 것

  • 교수 프라이밍(Dijksterhuis와 van Knippenberg, 1998): 사라졌습니다. 프라이밍은 미리 특정 개념을 떠올리게 해 이어지는 행동을 바꾼다는 기법입니다. '교수' 범주로 점화된 참가자가 상식 퀴즈에서 13% 더 잘했다던 결과는, 40개 실험실 중 포함 기준을 충족한 23개 실험실의 등록 재현(N=4,493)에서 조건 간 차이 0.14%가 됐습니다 (PMID 29463182).
  • 언어 은폐: 조건으로 살아남았습니다. 강도의 얼굴을 말로 묘사하면 범인 지목 정확도가 25% 떨어진다던 결과는, 사전등록 재현에서 묘사가 사건 직후일 때 4%, 20분 지연될 때 16%였습니다 (PMID 26186758). 저자들은 묘사 시점에 강하게 좌우되는 견고한 효과라고 결론짓습니다.
  • 표정 피드백: 부분 생존. 표정이 감정을 바꾼다는 가설입니다. 19개국 3,878명 다중랩에서 표정 흉내내기와 자발적 표정 과제는 행복감을 증폭하거나 일으켰지만, 펜을 물게 하는 고전적 과제에서는 증거가 덜 결정적이었습니다 (PMID 36266452).
  • 어린 시절 빈곤 × 사망 현저성(죽음을 떠올리게 하는 단서): 부분 재현(위험 감수만), 크기는 크게 축소. 원 연구의 14.2배 표본(1,010명 대 71명)에서 위험 감수 효과는 재현됐지만 효과크기 지표 η²가 0.17에서 0.004로 떨어졌고, 시간 선호 효과는 재현되지 않았습니다 (PMID 39666532). 저자들은 크게 줄어든 효과크기가 실질적 의미를 의심스럽게 만든다고 봅니다.
  • 그 밖에. 대리 부조화(내 집단 구성원의 모순된 행동을 보고 불편해지는 현상)는 g = 0.41에서 출판편향 보정 후 0.22가 됐고 (PMID 39126282), 사건부호화이론(행동과 지각이 같은 코드를 공유한다는 이론)의 고전 현상 여섯 개를 다중랩에서 다시 잰 연구는 원 결과의 핵심이 일관되게 다시 나왔으나 효과크기는 원래 보고보다 상당히 작았다고 보고했습니다 (PMID 35978172).

축소가 곧 부재는 아니다

작아졌다는 사실은 효과가 없다는 증거도, 누군가 속였다는 증거도 아닙니다. 효과가 작아지는 것이 전부 편향 때문은 아닙니다. 앞의 심리학 메타분석 조사(PMID 30321017)에서 연구 간 이질성의 중위값은 I² 74%였고, 잔여 보고편향은 작았습니다. I²는 관찰된 효과크기 변동 중 연구마다 진짜로 다른 효과에서 오는 몫입니다. 편향의 크기는 조사마다 다르게 평가됩니다. 앞의 출판편향 조사(PMID 38327122)는 대부분 의학인 68,000여 건 중 심리학 605건에서 보정 후 효과가 크게 줄었다고 보고했고, 이 조사는 200개 심리학 메타분석에서 잔여 편향이 작다고 봅니다. 대상과 방법이 다릅니다. 이 조사의 저자들은 낮은 검정력과 높은 이질성이 최근의 재현 곤란을 완전히 설명한다고 봅니다. 재현 실패의 상당 부분이 부정직이 아니라 변동 자체에서 올 수 있다는 해석입니다.

개념도. 왼쪽 칸 「0이다」 읽기: 조건 1~4의 막대가 모두 0 근처에 낮게 모인다. 오른쪽 칸 「작고 조건부다」 읽기: 조건 1~4의 막대 높이가 서로 다르고 일부는 0에 가깝다. 아래에는 23개 실험실 재현의 d=0.04, 95% 신뢰구간 −0.07~0.15가 0 선을 가로지르는 구간으로 그려져 있고, 이 한 건은 두 읽기 모두와 어긋나지 않는다는 설명이 붙어 있다. 막대 높이는 예시다.

이질성에도 종류가 있습니다. 모집단(누구를 재느냐), 설계(어떻게 재느냐), 분석(어떻게 계산하느냐)입니다. 70개 다중랩 재현과 5개 다중분석가 연구(같은 자료를 여러 팀이 각자 분석한 연구) 등을 묶은 분석은 모집단 이질성은 작은 편이고 설계 이질성과 분석 이질성이 크다고 정리합니다. 저자 틀에 따르면 이질성을 감안할 때 평균적인 모집단·설계·분석에서 가설이 참일 확률은 유의한 개별 연구가 시사하는 것보다 훨씬 낮을 수 있습니다. 저자들은 연구 수가 적고 추정의 불확실성이 커서 조심스럽게 읽어야 한다는 단서도 답니다 (PMID 39078672). 같은 자료를 여러 팀이 다르게 분석한 사례도 있습니다. 생후 9개월 영아 30명의 동공 자료를 7개 팀에 나눠 줬더니 두 팀은 유의한 결과를 찾지 못했고 나머지 다섯 팀은 서로 다른 패턴을 보고했습니다 (PMID 37944367). 프로토콜 충실도, 곧 절차를 원래대로 지킨 정도를 흔든 시뮬레이션만으로도 다중랩 재현에서 관찰되는 것과 닮은 통계적 패턴이 만들어졌습니다 (PMID 35049324). 표준 검정력 공식은 연구 간 변동을 아예 계산에 넣지 않아 검정력을 지나치게 낙관적으로 잡고, 이 공식으로 표본 크기를 정한 재현 연구는 예상보다 자주 실패하게 됩니다 (PMID 26186112). 상호작용이나 측정오차가 걸리면 계산은 더 크게 어긋납니다 (PMID 32208875).

그리고 축소는 보편 법칙이 아닙니다. 생태학 메타분석 466건에서 시간에 따른 진짜 방향성 변화는 약 5%뿐이었고, 겉보기 하락 대부분은 평균회귀로 설명됐습니다 (PMID 35302660). 평균회귀는 처음에 유난히 큰 값이 나온 뒤 다음 측정에서 평균 쪽으로 돌아오는 경향입니다. 출판편향의 지문으로 읽혀 온 "표본이 작을수록 효과가 크다"는 상관도 메타분석 150건과 다중재현 57건에서는 두드러지지 않았고 논문의 핵심 효과에서만 훨씬 컸습니다. 이것을 출판편향 탓으로 돌려야 할지는 불분명하다고 저자들은 적습니다 (PMID 38359021).

정직한 미해결

참값을 모릅니다. 교정 방법마다 답이 다릅니다. 수축추정량, 곧 과장을 줄이려고 추정치를 평균 쪽으로 당기는 방법은 보정하지 않은 통상의 추정량보다 나은 성능을 보였습니다 (PMID 34425632, PMID 38111969). 비슷한 연구들의 정보를 빌려 개별 값을 조정하는 위계 베이즈 재보정에서는 뇌영상 사례-대조 연구 21편에서 조정 폭이 최대 0.97에 이르렀고 표본이 작을수록 컸습니다 (PMID 38179200). 게다가 재현 여부를 판정하는 검정 자체의 검정력이 낮은 경우가 많습니다 (PMID 30070547).

축소와 부재를 가르는 원칙이 없습니다. 과학적 방법은 음성을 증명하지 못하며 통계만으로 심리 현상의 비존재를 선언할 수 없다는 반론이 있습니다 (PMID 28626435). 정당한 논증이지만 어떤 반증도 받아들이지 않는 태도로 미끄러질 위험도 있습니다. 양쪽 다 적어 둡니다.

개선되고 있는지도 애매합니다. 12개 학술지 57,909편에서 중위 표본 크기는 105명에서 190명으로 늘었습니다. 효과크기와 신뢰구간 보고는 늘었지만 논문당 유의한 p값의 비율은 69%로 그대로였고 다중검정 보정 사용은 오히려 줄었습니다 (PMID 37163505).

어떤 설계는 애초에 큰 효과를 냅니다. 63개 연구·52,979명 분석에서 뇌 영역 대부분의 개인 간 효과, 곧 사람들 사이의 차이를 비교한 효과는 |d| < 0.2였습니다. 가장 강한 국소 효과조차 80% 검정력에 n > 500이 필요했습니다. 반면 다변량 분석과 개인 내 과제 설계, 곧 같은 사람의 조건 간 차이를 보는 설계는 n < 50에서도 잡혔습니다 (PMID 42281980, PMID 35296861). 효과크기는 설계에 따라 크게 달라서, 설계가 다른 연구의 크기를 같은 눈금으로 기대하기 어렵습니다.

의의 — "작아졌다"를 읽는 법

한 줄로 줄이면 이렇습니다. 축소는 예보입니다. 스캔들로 읽을 일이 아닙니다.

그래서 남길 것은 판정이 아니라 다섯 개의 질문입니다.

  • 처음 보고된 표본은 몇 명인가.
  • 그 발견이 사전에 정해진 가설이었나, 아니면 여러 후보 중 문턱을 넘은 하나였나.
  • 재현은 사전등록되고 다중랩이었나.
  • 축소가 0으로 갔나, 조건으로 갔나. 교수 프라이밍은 앞쪽이고 언어 은폐는 뒤쪽입니다.
  • 저자가 교정된 추정치를 함께 보고했나.

재현 연구로 검증받은 패러다임의 결말은 한 논문이 든 세 사례에서도 갈렸습니다. 하나는 연구 전체가 진짜 발견을 가리키고, 하나는 효과가 크게 줄었고, 하나는 논쟁 중입니다 (PMID 33682522). 이 구분이 필요하다는 것이 이 편의 입장입니다. 대규모 다중랩 재현 프로젝트는 목적을 달성했으니 이제 다른 종류의 재현으로 넘어갈 때라는 논평도 있습니다 (PMID 31064594).

마지막 톱니는 사람입니다. 저자 1인의 한 논문은 카너먼과 트버스키의 고전 실험을 학부생 대신 과학자에게 다시 돌렸더니 본질적으로 같은 결과가 나왔다고 보고합니다. 데이터의 질과 무관하게 일관된 이야기를 만들려 하고 없는 패턴을 찾으려 하는 경향이 과학자에게도 있다는 것이고, 저자는 이를 훈련으로 줄일 수 있다고 덧붙입니다 (PMID 30197928, 단일 연구). "작아졌다"는 소식은 배신이 아닙니다. 심리학에서 문턱을 넘은 첫 보고를 다시 잴 때 흔히 마주치는 결과에 가깝습니다. 모든 분야, 모든 발견이 그런 것은 아닙니다. 우리는 이제 막 그 점을 계산에 넣는 법을 배우는 중입니다.

근거 논문

  • "Estimating the reproducibility of psychological science" (2015) — PMID 26315443 — 100편 재현. 재현 효과크기는 원 효과크기의 절반, 36%만 유의.
  • "What meta-analyses reveal about the replicability of psychological research" (2018) — PMID 30321017 — 200개 메타분석·12,065 효과크기. 중위 검정력 36%, 이질성 중위 I² 74%, 잔여 보고편향은 작음.
  • "Power failure: why small sample size undermines the reliability of neuroscience" (2013) — PMID 23571845 — 저검정력이 효과크기 과대추정과 낮은 재현성을 낳는다는 고전적 정리.
  • "Power-up: A Reanalysis of 'Power Failure' in Neuroscience Using Mixture Modeling" (2017) — PMID 28706080 — 중위 검정력 21%는 단일 요약값으로 과대 일반화. 하위 분야 편차가 큼.
  • "The statistical properties of RCTs and a proposal for shrinkage" (2021) — PMID 34425632 — 코크런 23,551쌍. 중위 달성 검정력 13%, 겨우 유의한 추정치의 과장비 1.7배.
  • "Quantifying and correcting for the winner's curse in genetic association studies" (2009) — PMID 19140131 — 승자의 저주의 정식화. 과장은 검정력이 오를수록 줄어듦.
  • "Curses--winner's and otherwise--in genetic epidemiology" (2008) — PMID 18703928 — 초기 보고 효과가 후속 연구보다 과장되는 현상과 과적합.
  • "Statistical correction of the Winner's Curse explains replication variability" (2017) — PMID 28715421 — 좌위별 표본을 정확히 보고한 39건·707좌위에서 예측 458 대 실제 457.
  • "Cryptic multiple hypotheses testing in linear models" (2011) — PMID 21297852 — 예측변수 4개+상호작용에서 시작한 모형 단순화는 귀무가설이 모두 참이어도 40% 확률로 유의 결과를 낳음.
  • "Voodoo Correlations Are Everywhere-Not Only in Neuroscience" (2011) — PMID 26162135 — 복셀뿐 아니라 자극·과제·경계 조건·변수 선택 전반이 효과를 부풀림.
  • "Publication selection in health policy research: the winner's curse hypothesis" (2013) — PMID 23182564 — 영향력 높은 학술지가 더 큰 탄력성 추정치를 실음.
  • "Footprint of publication selection bias on meta-analyses" (2024) — PMID 38327122 — 메타분석 68,000여 건. 보정 후 중위 d: 심리학 0.37→0.26, 경제학 0.20→0.07, 의학 0.24→0.13.
  • "The Rules of the Game Called Psychological Science" (2012) — PMID 26168111 — 유의성 수집이 목표라면 작은 표본 여러 개가 더 효율적이라는 시뮬레이션.
  • "Overestimation of benefit when clinical trials stop early" (2022) — PMID 36064448 — 조기 종료 시험의 참 상대위험감소는 관측값의 약 3분의 2.
  • "Ego depletion and the strength model of self-control: a meta-analysis" (2010) — PMID 20565167 — 83편 메타분석. 유의한 효과와 "예비적 지지".
  • "A Multilab Preregistered Replication of the Ego-Depletion Effect" (2016) — PMID 27474142 — 23랩 N=2,141, d=0.04 [−0.07, 0.15].
  • "A Multilab Replication of the Ego Depletion Effect" (2021) — PMID 34113424 — 12랩 N=1,775, d=0.10, 배제 후 0.16.
  • "A Multisite Preregistered Paradigmatic Test of the Ego-Depletion Effect" (2021) — PMID 34520296 — 36랩 N=3,531. 확증 d=0.06 비유의, 베이즈 4배 귀무 우세.
  • "Testing the role of glucose in self-control: A meta-analysis" (2016) — PMID 27492453 — 혈당 모형 세 따름명제 모두 미지지.
  • "The Bitter Truth About Sugar and Willpower" (2016) — PMID 27485134 — p-곡선 분석. 증거가치 약함.
  • "Sweet delusion. Glucose drinks fail to counteract ego depletion" (2014) — PMID 24389240 — 직접 재현 2건 모두 실패.
  • "Does willpower mindset really moderate the ego-depletion effect?" (2023) — PMID 37384732 — 원 표본 60명 대 재현 187명. 주효과·조절효과 모두 재현 실패.
  • "An updated meta-analysis of the ego depletion effect" (2018) — PMID 28391367 — 편향 보정 기법 적용의 부적절성을 지적한 재-메타분석.
  • "Bayesian analysis of multimethod ego-depletion studies favours the null hypothesis" (2018) — PMID 29314092 — 세 프로토콜·840명. 귀무가설 강한 지지.
  • "Self-reports from behind the scenes" (2018) — PMID 29940020 — 응답자 277명 중 37.7%가 문제적 연구 관행 사용 인정.
  • "Effects of Prior Cognitive Exertion on Physical Performance" (2020) — PMID 31873926 — 73편·2,581명, g=−0.38.
  • "Assessing the Evidential Value of Mental Fatigue and Exercise Research" (2023) — PMID 37682411 — 보정 후 대부분 무시할 수준, 낙관 시나리오에서도 −0.36.
  • "A systematic review and meta-analysis of growth mindset interventions" (2023) — PMID 36227318 — 53표본. 조건부 학업 d=0.14, 정신건강 d=0.32, 학업 예측구간 −0.08~0.35.
  • "A national experiment reveals where a growth mindset improves achievement" (2019) — PMID 31391586 — 전국 대표 표본. 저성취 학생 성적 향상, 또래 규범 의존.
  • "When Do Growth Mindset Interventions Work?" (2019) — PMID 31494041 — 그 향상 폭은 GPA 0.10점.
  • "Growth-Mindset Intervention Delivered by Teachers Boosts Achievement" (2022) — PMID 35699476 — 교사 전달형, 0.27 표준편차.
  • "Teacher Mindsets Help Explain Where a Growth-Mindset Intervention Does and Doesn't Work" (2022) — PMID 34936529 — 교사 마인드셋이 학생 효과를 조절.
  • "Mindsets, contexts, and college enrollment" (2024) — PMID 39073263 — 9학년 마인드셋이 4년 뒤 대학 진학 예측, 팬데믹 이후 약화.
  • "Mindsets: A View From Two Eras" (2019) — PMID 30707853 — 원 발견자 쪽 서술. 현장 실험·재현 과학 시대로의 이행 인정.
  • "Grit, resilience and growth-mindset interventions in health professional students" (2024) — PMID 38600797 — 성장 마인드셋 개입 SMD 0.25 [−0.18, 0.68].
  • "Neglect of publication bias compromises meta-analyses of educational research" (2021) — PMID 34081730 — 교육학 메타분석의 출판편향 보정 생략.
  • "A Metaanalysis of the relationship between growth mindset and mental health in Chinese samples" (2024) — PMID 39504841 — 59편·54,302명. r=0.36 / −0.25.
  • "Understanding and using the Implicit Association Test: III" (2009) — PMID 19586237 — 122보고·14,900명, 평균 r=.274.
  • "Strong claims and weak evidence" (2009) — PMID 19449998 — 두 인용 빈번한 연구 재분석. 개인 수준 행동 예측 실패.
  • "Predicting ethnic and racial discrimination: a meta-analysis of IAT criterion studies" (2013) — PMID 23773046 — 뇌활동 외 모든 준거 범주에서 빈약, 자기보고보다 낫지 않음.
  • "A closer look at the discrimination outcomes in the IAT literature" (2016) — PMID 27109866 — 준거 정제 후 효과는 0에 가깝고 매우 비일관.
  • "Relationship between the Implicit Association Test and intergroup behavior" (2019) — PMID 30550298 — 217보고·36,071명. β=.14, 방법 조건 상위 r=.37 대 하위 r=.02.
  • "Predicting Behavior With Implicit Measures" (2019) — PMID 31787912 — 20년 총평. 예측력 약함, 증분타당도 무시할 만함.
  • "Statistically small effects of the IAT can have societally large effects" (2015) — PMID 25402677 — 두 메타의 차이는 포함 정책. 어느 쪽이든 사회적 영향 설명에는 충분.
  • "Invalid Claims About the Validity of Implicit Association Tests" (2021) — PMID 33709849 — 다중방법 구조방정식에서 암묵 구성개념 측정 증거 없음.
  • "Specificity and incremental predictive validity of implicit attitudes" (2021) — PMID 34487286 — 표현형 맞춤 IAT의 증분 예측.
  • "Test-retest reliability and predictive validity of the IAT in children" (2018) — PMID 29251966 — 재검사 .34~.48, 예측타당도 .10~.46.
  • "Implicit racial bias among medical graduates and students" (2022) — PMID 34495481 — 통합 0.28·0.35, 크기는 작음.
  • "Registered Replication Report: Dijksterhuis and van Knippenberg (1998)" (2018) — PMID 29463182 — 원 13% → 23랩 N=4,493에서 0.14%.
  • "Registered Replication Report: Schooler and Engstler-Schooler (1990)" (2014) — PMID 26186758 — 원 25% → 즉시 4%, 20분 지연 16%.
  • "A multi-lab test of the facial feedback hypothesis" (2022) — PMID 36266452 — 19개국 3,878명. 과제 종류에 따라 부분 생존.
  • "Childhood poverty and its impact on financial decision making under threat" (2025) — PMID 39666532 — 표본 14.2배. η² 0.17→0.004, 시간 선호는 재현 실패.
  • "Vicarious Dissonance: Pre-Registered Meta-Analysis" (2026) — PMID 39126282 — g=0.41 → 선택 모형 보정 후 0.22.
  • "Perception and action as viewed from the Theory of Event Coding" (2023) — PMID 35978172 — 고전 현상 6종 다중랩. 재현되나 효과크기는 상당히 작음.
  • "Heterogeneity in effect size estimates" (2024) — PMID 39078672 — 모집단 이질성은 작고 설계·분석 이질성이 큼.
  • "The pupil collaboration" (2023) — PMID 37944367 — 같은 데이터, 7개 팀. 두 팀은 유의 결과 없음.
  • "Is replication possible without fidelity?" (2023) — PMID 35049324 — 충실도 조작 시뮬레이션이 다중랩 패턴을 재현.
  • "You Cannot Step Into the Same River Twice" (2014) — PMID 26186112 — 연구 간 변동을 무시하는 검정력 공식은 낙관적.
  • "On Attenuated Interactions, Measurement Error, and Statistical Power" (2020) — PMID 32208875 — N>500의 2×2 설계 여섯 편도 저검정력일 수 있음.
  • "Decline effects are rare in ecology" (2022) — PMID 35302660 — 466개 메타분석. 진짜 하락은 약 5%, 대부분은 평균회귀.
  • "Publication bias in psychology: A closer look" (2024) — PMID 38359021 — 메타분석에서는 두드러지지 않고 논문의 핵심 효과에서만 큼.
  • "Evaluating a shrinkage estimator for the treatment effect in clinical trials" (2024) — PMID 38111969 — 수축추정량이 불편추정량보다 우수.
  • "Recalibrating single-study effect sizes using hierarchical Bayesian models" (2023) — PMID 38179200 — 조정 폭 0~0.97, 표본이 작을수록 큼.
  • "Statistical analyses for studying replication" (2019) — PMID 30070547 — 재현 판정 검정 자체의 검정력이 낮음.
  • "Reproducibility in Psychological Science: When Do Psychological Phenomena Exist?" (2017) — PMID 28626435 — 과학은 음성을 증명하지 못한다는 반론.
  • "Changes in methodological study characteristics in psychology between 2010-2021" (2023) — PMID 37163505 — 중위 표본 105→190, 유의 p 비율 69% 불변, 다중검정 보정은 감소.
  • "Effect sizes in human functional neuroimaging" (2026) — PMID 42281980 — 개인 간 효과 대부분 |d|<0.2, 다변량·개인 내 설계는 n<50.
  • "Reproducible brain-wide association studies require thousands of individuals" (2022) — PMID 35296861 — 안정적 뇌-행동 연관에는 수천 명 필요.
  • "What the replication reformation wrought" (2018) — PMID 31064594 — 다중랩 프로젝트는 목적을 달성했고 다른 재현으로 넘어갈 때.
  • "Saving Science Through Replication Studies" (2022) — PMID 33682522 — 진짜 발견·크게 줄어든 효과·논쟁 중인 것 세 갈래.
  • "Why Is It so Hard to Do Good Science?" (2018) — PMID 30197928 — 과학자에게 다시 돌린 카너먼·트버스키 실험.

🏛️ 이 글의 뿌리가 된 논문

이 글이 근거로 삼은 논문 중 ‘거인의 어깨’에 오른 초석 연구예요. 개념을 익혔다면 원전으로 가보세요.

  • Estimating the reproducibility of psychological science2015

    심리학 논문 100편을 재현하여 문헌 전체의 효과 크기가 원본의 절반임을 밝혔습니다.

    이 분야의 거인의 어깨 →
📚 심리·사회과학 — 사람을 재는 법
3 / 7
  1. 1.심리학의 재현 위기 — 우리가 믿었던 발견들은 왜 흔들렸나
  2. 2.연구자 자유도와 p-해킹 — 조작 없이도 원하는 결과가 나오는 법
  3. 3.사라지는 효과 — 교과서에 실렸던 발견들은 왜 다시 재면 작아지는가
  4. 4.누구를 재고 있었나 — 심리학이 "사람"이라고 말할 때의 그 사람
  5. 5.스탠퍼드 감옥실험은 무엇을 보여 줬나 — '상황이 악마를 만든다'는 서사에 제기된 비판들
  6. 6.무작위 대조시험은 정말 '황금표준'인가
  7. 7.실험 없이 인과를 묻는 법 — 자연실험과 네 가지 설계
← 이전 글연구자 자유도와 p-해킹 — 조작 없이도 원하는 결과가 나오는 법다음 글 →누구를 재고 있었나 — 심리학이 "사람"이라고 말할 때의 그 사람

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.