Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

실험 없이 인과를 묻는 법 — 자연실험과 네 가지 설계

무작위 실험이 어려울 때 「무엇이 무엇을 일으켰는가」를 묻는 네 가지 설계 — 이중차분·도구변수·회귀불연속·합성통제

🔬방법론✦AI 생성심리·사회과학 · 2026년 10월 10일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

실험 없이 인과를 묻는 법 — 자연실험과 네 가지 설계

여름이면 아이스크림 판매량이 오르고, 같은 계절에 익사 사고도 늘어납니다. 그렇다고 아이스크림이 익사를 부른다고 말하는 사람은 없습니다. 둘 다 '더위'라는 제3의 원인이 함께 밀어올린 것뿐이기 때문입니다. 이 예에서는 상관(두 값이 함께 오르내리는 관계)과 인과(하나가 다른 하나를 실제로 일으키는 관계)를 쉽게 구별합니다. 하지만 현실의 질문 대부분은 이만큼 친절하지 않습니다. 최저임금을 올리면 일자리가 줄어드는가? 대학 진학은 소득을 얼마나 높이는가? 어떤 약이 정말 수명을 늘리는가? 이런 물음에는 숨은 '더위'가 도처에 있습니다.

인과를 가로막는 함정은 크게 셋입니다. 아래에서 처치는 효과를 알고 싶은 개입(정책, 약, 학력 같은 것)을, 결과는 그 개입 뒤에 달라졌는지 보려는 값(고용, 소득, 수명 같은 것)을 가리킵니다.

  • 교란(confounding)은 처치와 결과를 동시에 움직이는 숨은 요인입니다. 아이스크림과 익사 사이의 더위가 그렇습니다.
  • 선택편향(selection bias)은 처치를 받은 사람과 안 받은 사람이 애초에 다른 사람들이라는 문제입니다. 대학에 가는 사람은 원래 소득 잠재력이 높을 수 있습니다.
  • 역인과(reverse causation)는 원인과 결과의 방향이 반대일 가능성입니다. 건강해서 커피를 더 마시는 것인지, 커피가 건강을 지킨 것인지 알 수 없는 경우입니다.

이 셋을 걷어내지 못하면 데이터가 아무리 많아도 상관은 인과가 되지 못합니다. 교란과 보정이 논문에서 어떻게 쓰이는지는 「"연령·성별·BMI 보정"은 무엇을 했나 — 교란과 보정을 읽는 법」에서 다뤘습니다.

가장 깨끗한 해법은 무작위 대조시험(RCT)입니다. 동전을 던져 처치군과 대조군을 나누면, 두 집단은 평균적으로 관측되든 안 되든 모든 면에서 같아지고 처치 여부만 다릅니다. 그래서 결과의 차이를 처치 탓으로 돌릴 수 있습니다. RCT가 정말 '황금표준'인지는 「무작위 대조시험은 정말 '황금표준'인가」에서 따로 따졌습니다. 이 글은 그 앞에서 막히는 경우를 다룹니다. 최저임금을 어떤 도시에는 올리고 어떤 도시에는 안 올리도록 무작위로 정할 수는 없습니다. 국민을 제비뽑아 누구는 대학에 보내고 누구는 막을 수도 없습니다. 경제학·사회학·역학이 다루는 큰 질문은 대개 실험이 불가능하거나 비윤리적입니다.

그래서 지난 반세기 동안 사회과학은 다른 길을 찾았습니다. 실험을 할 수 없다면 세상이 우연히 만들어 준 '거의 무작위'인 상황을 찾아 쓰는 것입니다. 이 글은 그 도구상자를 엽니다. 목표는 실증 경제학이나 역학 논문을 펼쳤을 때, 저자가 무엇을 무엇과 비교해 인과를 주장하는지(식별 전략, identification strategy)를 읽어낼 수 있게 하는 것입니다. 그 비교가 인과 효과를 가리킨다고 인정받으려면 데이터가 말해 주지 않는 조건을 연구자가 믿어야 합니다. 이 조건을 식별 가정이라 부르고, 글 전체가 이 가정을 따라갑니다. 근거의 대부분은 동료심사 전 원고인 arXiv 프리프린트이므로, 글 끝의 고지를 함께 읽어 주십시오.

보지 못한 세계와의 비교 — 반사실이라는 사고틀

현대 인과추론의 출발점은 단순하고도 불편한 관찰입니다. 어떤 사람이 대학에 진학했을 때의 소득과, 바로 그 사람이 진학하지 않았을 때의 소득이 있습니다. 이 둘의 차이가 그 사람에게 대학이 미친 진짜 효과이고, 둘을 합쳐 잠재적 결과(potential outcomes)라 부릅니다. 문제는 둘 중 하나만 관측된다는 것입니다. 진학한 사람이 '진학하지 않았다면' 얻었을 소득은 영원히 볼 수 없습니다. 이렇게 일어나지 않은 쪽의 보이지 않는 세계를 반사실(counterfactual)이라 합니다. 인과추론의 근본 문제는 반사실을 어떻게 채워 넣을 것인가입니다.

RCT는 무작위 배정으로 이 문제를 풉니다. 통계적으로 같아진 대조군이 처치군의 반사실을 대신 보여주기 때문입니다. 실험 없는 인과추론도 같은 일을 합니다. 다만 무작위 배정을 연구자가 만드는 대신 이미 세상에 있는 '거의 무작위' 배정을 찾아냅니다. 현대 사회과학의 인과추론 방법론은 이 식별 가정들과, 가정이 깨졌을 때의 대응책을 체계화해 온 문헌입니다 (arXiv:2408.00032).

자연실험 — 세상이 대신 던진 동전

이 도구상자를 연 창립 연구들은 대부분 경제학이 프리프린트(arXiv)에 논문을 올리기 시작한 2017년 무렵보다 앞섭니다. 카드와 크루거의 1994년 최저임금 연구(뉴저지·펜실베이니아 접경의 패스트푸드 고용을 비교한 이중차분), 앵그리스트의 베트남전 징집 추첨을 이용한 도구변수 연구, 앵그리스트와 임벤스의 국소평균처치효과(LATE) 정식화, 카드의 1990년 마리엘 보트리프트 연구가 그렇습니다. 그래서 이 글은 원 논문을 직접 인용하지 못하고, 이 방법들을 오늘날 정리·확장한 현대의 방법론 논문을 근거로 삼습니다. 창립기의 사건들(2021년 카드·앵그리스트·임벤스의 노벨 경제학상, 그 흐름을 부르는 이름 '신뢰성 혁명(credibility revolution)')은 널리 알려진 사실로 서술하고, 방법 자체의 설명은 현대 논문에 기댑니다.

1980년대까지 실증 경제학은 복잡한 회귀모형(변수 사이의 관계를 식으로 맞추는 통계 방법)에 온갖 변수를 넣고 "다른 조건이 같다면"을 통계적으로 흉내 내는 방식에 크게 기댔습니다. 그러나 넣지 못한 숨은 변수가 늘 남았고, 결론은 모형을 어떻게 짜느냐에 따라 흔들리곤 했습니다. 1990년대에 이르러 흐름이 바뀌었습니다. 연구자들은 정교한 모형 대신 깨끗한 비교 상황을 찾기 시작했습니다. 정책이 어떤 지역에는 적용되고 이웃 지역에는 안 됐거나, 법이 특정 생년월일을 기준으로 갈리거나, 추첨으로 무언가가 배정되는 순간들입니다. 이런 상황을 자연실험(natural experiment)이라 부릅니다. 이 방법론적 전환은 훗날 '신뢰성 혁명'이라 불렸고, 2021년 노벨 경제학상이 그 공로를 기렸습니다(이 명명과 수상은 널리 알려진 사실입니다).

'자연실험'이라는 말은 실제로는 느슨하게 쓰입니다. 연구자가 아닌 누군가(정부·자연·제도)가 처치를 정말로 무작위로 배정한 경우만 가리키는 쓰임이 있고, 통제된 무작위 배정이 없는 관찰연구 전반을 가리키는 쓰임도 있습니다. 한 방법론 논문은 자연실험을 엄밀하게 정의하려 시도합니다. 이 정의에서는 배정 메커니즘이 (i) 연구자가 설계·집행하지 않았고 (ii) 연구자에게 알려져 있지 않으며 (iii) 외부 요인에 따라 확률적이어야 합니다. 이 논문은 여기에 경고를 덧붙입니다. 자연실험과 무작위 실험의 차이는 '정도의 차이'가 아니라 '본질의 차이'이므로, 자연실험을 무작위 실험과 똑같이 취급하는 것은 엄밀하지도 유용하지도 않다는 것입니다 (arXiv:2002.00202). 이 경고를 염두에 두고 네 가지 대표 설계를 하나씩 봅니다.

설계 1 — 이중차분법(DiD): '변화의 차이'를 본다

답하는 질문: 어떤 정책이 한 집단에는 시행되고 다른 집단에는 시행되지 않았을 때, 그 정책의 효과는 얼마인가?

직관은 이렇습니다. 정책 시행 전후로 처치군(정책을 받은 집단)의 결과가 얼마나 변했는지만 보면 부족합니다. 그사이 경기와 계절 등 온 세상이 함께 변했을 것이기 때문입니다. 그래서 정책을 받지 않은 대조군의 같은 기간 변화를 뺍니다. 처치군의 변화에서 대조군의 변화를 뺀 값, 곧 '변화의 차이(difference in differences)'가 이중차분법의 정책 효과 추정치입니다. 카드와 크루거의 고전적 연구는 최저임금을 올린 뉴저지의 고용 변화에서, 올리지 않은 이웃 펜실베이니아의 고용 변화를 뺀 것으로 알려져 있습니다.

절차는 가장 단순한 형태에서 두 집단(처치·대조)과 두 시점(전·후)을 곱한 2×2 표입니다. 각 칸의 평균을 구하고 (처치군 후 − 처치군 전) − (대조군 후 − 대조군 전)을 계산하면 끝입니다. 이 정준형은 잘 이해돼 있습니다. 현실의 연구는 여기서 훨씬 나아갑니다. 시점이 여러 개이고, 집단의 다른 특성(공변량)을 보정하고, 가중치를 쓰고, 집단마다 정책이 서로 다른 시점에 도입되는 '시차 도입(staggered adoption)'까지 다룹니다. 이 확장에서 실무가 뒤죽박죽이 되기 쉬워서, 최근 한 실무 지침 논문은 DiD 설계의 유형과 거기에 맞는 추정량(효과를 계산하는 공식)을 정리하는 틀을 제시했습니다 (arXiv:2503.13323).

결과는 대개 '이벤트 스터디(event study)' 그림으로 읽습니다. 이 그림은 DiD 분석의 중심에 놓이는 그림으로 꼽힙니다 (arXiv:2512.06804). 가로축은 정책 시행 시점을 0으로 놓은 상대 시간이고, 세로축은 처치군과 대조군의 결과 격차입니다. 시점 0 이전의 점들은 0 근처에 평평하게 누워 있어야 합니다. 정책이 없던 시절에는 두 집단이 나란히 움직였다는 뜻이기 때문입니다. 시점 0 이후에 격차가 벌어지면, 그 벌어짐이 시간에 따라 변하는 정책 효과입니다.

DiD의 핵심 가정은 평행추세(parallel trends)입니다. 정책이 없었다면 처치군과 대조군의 결과가 나란히(평행하게) 움직였을 것이라는 가정입니다. 뒤에서 다룰 가장 중요한 함정이 여기에 있습니다. 정책 이전 시기의 격차가 평평하다는 사실은 이 가정에 대한 정황 증거가 될 뿐, 증명은 되지 못합니다.

이중차분 개념도. 가로로 정책 전과 정책 후 두 시점, 세로는 눈금 없는 결과. 대조군은 전에서 후로 일정 폭 변하고, 처치군은 더 낮은 곳에서 출발합니다. 처치군 출발점에서 대조군과 같은 기울기로 그은 점선이 '정책이 없었다면' 갔을 경로(평행추세 가정, 관측 불가)이고, 처치군의 실제 도착점과 점선 끝 사이의 간격이 변화의 차이, 곧 정책 효과의 추정치입니다. 평행추세는 검정이 아니라 가정이라는 문구가 붙어 있습니다.

설계 2 — 도구변수(IV): 처치에만 닿는 지렛대

답하는 질문: 처치를 스스로 선택한 사람과 안 한 사람이 애초에 달라서(선택편향·역인과) 단순 비교가 어긋날 때, 처치의 인과 효과를 어떻게 뽑아낼 것인가?

직관은 이렇습니다. 처치(흡연, 진학, 음주)에는 영향을 주지만 결과에는 오직 처치를 통해서만 닿는 외부의 지렛대를 찾습니다. 이 지렛대가 도구변수(instrumental variable)입니다. 지렛대가 '거의 무작위로' 처치를 밀었다 당겼다 한다면, 그 밀고 당김이 결과에 미친 파급을 통해 처치의 효과를 역산할 수 있습니다. 앵그리스트가 베트남전 징집 추첨 번호를 도구로 써서 군 복무가 훗날 소득에 미친 효과를 추정한 것이 교과서적 예입니다. 추첨 번호는 무작위로 정해지므로 개인의 성향과는 얽히지 않습니다. 다만 번호가 군 복무 외의 경로로 소득에 영향을 주지 않는다는 배제 제약은 여전히 논증해야 합니다.

도구가 되려면 두 조건이 필요합니다. 첫째는 관련성(relevance)으로, 도구가 실제로 처치를 움직여야 합니다. 둘째는 배제 제약(exclusion restriction)으로, 도구가 결과에 미치는 영향이 오로지 처치를 거쳐서만 이뤄져야 하고 다른 경로로 새어 나가면 안 됩니다. 예컨대 유전적 변이를 음주의 도구로 삼은 분석이 있습니다. 유전자는 태어날 때 정해져 생활습관과 덜 얽힌다는 가정에 기댄 착상이며, 역학에서는 이를 '멘델리안 무작위화'라 부릅니다. 다만 그 유전자가 다른 경로로 결과에 영향을 주면 배제 제약이 깨지므로, 이 가정도 논증이 필요합니다. 다수의 약한 도구를 다루는 검정법을 다룬 논문(arXiv:2604.15437)이 이 착상을 UK 바이오뱅크 자료에 적용해, 음주가 체질량지수(BMI)에 미치는 효과를 연구한 예시를 보였습니다.

도구변수 화살표 도식. 왼쪽 도구(징집 추첨 번호)에서 가운데 처치(군 복무)로 '관련성' 화살표, 처치에서 오른쪽 결과(훗날 소득)로 화살표가 있습니다. 위쪽의 숨은 요인은 처치와 결과 양쪽으로 화살표를 보냅니다. 도구에서 결과로 직접 가는 붉은 점선 경로에는 가위표가 있고 '배제 제약: 이 길이 없어야 함, 논증으로 방어해야 하는 가정'이라고 적혀 있습니다. 아래에는 유전 변이 → 음주 → 체질량지수라는 같은 구조의 예와, 추정값이 순응자에 대한 효과(LATE)라는 문구가 있습니다.

절차의 표준 방법은 2단계 최소제곱(2SLS)입니다. 1단계에서 도구로 처치를 예측하고, 2단계에서 그 '예측된 처치'로 결과를 설명합니다. 도구가 밀어낸 변동만 골라 쓰므로, 처치가 스스로 선택된 부분(오염된 부분)을 우회합니다.

결과를 읽을 때 놓치기 쉬운 점이 있습니다. IV가 추정하는 값은 모든 사람의 평균 효과와 다릅니다. 도구에 반응해 처치를 바꾼 사람들, 곧 '순응자(complier)'에 대한 효과입니다. 징집 추첨의 예에서는 번호가 나빠서 입대한(그리고 번호가 좋았다면 입대하지 않았을) 사람들에 대한 효과만 식별됩니다. 이 값을 국소평균처치효과(LATE, Local Average Treatment Effect)라 하며, 정식화는 임벤스와 앵그리스트의 1994년 연구로 거슬러 올라가는 것으로 알려져 있습니다. 그 가정을 동적 설정으로 확장한 연구도 있습니다 (arXiv:2405.01463). LATE는 강력하지만 '누구에 대한' 효과인지를 반드시 물어야 하는 제한적인 수치입니다.

설계 3 — 회귀불연속(RDD): 임계값의 양옆

답하는 질문: 어떤 자격이나 처치가 연속적인 점수의 임계값(cutoff)을 기준으로 딱 갈릴 때, 그 처치의 효과는 얼마인가?

직관은 이렇습니다. 시험에서 60점이 합격선이라고 합시다. 59점과 61점을 받은 두 학생은 실력이 사실상 같은데 한 명은 떨어지고 한 명은 붙습니다. 임계값 바로 양옆의 사람들은 '거의 같은' 대상인데 처치만 갈렸으므로, 이 좁은 창에서는 마치 무작위 배정처럼 볼 수 있습니다. 임계값 바로 위와 아래에서 결과가 불연속적으로 튀는 크기가 처치의 효과이고, 이 방법이 회귀불연속(regression discontinuity) 설계입니다.

절차는 이렇습니다. 가로축에 점수(처치를 가르는 기준이 되는 값이라 '러닝 변수'라 부릅니다), 세로축에 결과를 놓습니다. 임계값의 왼쪽과 오른쪽에서 각각 결과의 추세를 추정한 뒤, 임계값에서 두 추세 사이에 벌어지는 '점프'를 잽니다. 핵심 식별 가정은 연속성입니다. 처치가 없었다면 결과의 기댓값이 임계값을 가로질러 매끄럽게 이어졌으리라는 것입니다 (arXiv:2507.12693).

의과학에서의 회귀불연속 입문은 arXiv:2508.03878에 정리돼 있습니다. 결과를 읽을 때는 임계값에서의 점프 크기와, 양옆 추세선이 얼마나 안정적으로 추정됐는지를 봅니다. 인상적인 사례로 스웨덴이 있습니다. 스웨덴은 1975년 신생아 BCG 결핵 예방접종을 중단했고, 접종률이 92%에서 2%로 급락했습니다. 한 프리프린트 연구는 그 경계 전후에 태어난 약 100만 명씩의 코호트(같은 시기에 태어난 집단)를 회귀불연속으로 비교해 신생아 때 받은 BCG 접종이 코로나19를 막아 주는지 시험했습니다. 저자들은 신생아 때 받은 접종이 보호 효과를 내지 않는다는 강력한 증거를 얻었다고 결론 내리며, 최근 접종의 효과는 별도로 평가해야 한다고 덧붙입니다. 확진자 수를 20% 넘게 줄일 가능성까지 95% 신뢰수준에서 기각할 만큼 정밀했다는 것입니다 (arXiv:2006.05504). 실험을 설계하지 않고도 제도가 그어 놓은 날짜 하나가 거대한 자연실험이 된 셈입니다.

설계 4 — 합성통제(synthetic control): 가상의 쌍둥이를 만든다

답하는 질문: 처치를 받은 대상이 단 하나(한 나라, 한 도시, 한 주)뿐이라면 어떻게 하는가? 비교할 대조군이 없는데 반사실을 어떻게 그리는가?

직관은 이렇습니다. 마땅한 단일 대조가 없으면 여러 후보 대조를 가중조합해 처치 대상을 꼭 닮은 '가상의 쌍둥이'를 합성합니다. 이것이 합성통제입니다. 예컨대 특정 정책을 편 한 주(州)의 반사실을, 정책 이전의 궤적이 그 주와 가장 비슷해지도록 다른 여러 주에 가중치를 주어 조합한 '합성 주'로 대신합니다. 처치 이후 실제 대상과 이 합성 쌍둥이가 벌어지는 격차가 정책 효과의 추정치입니다.

가중치는 처치 이전 시기의 결과(와 예측변수)를 최대한 맞추도록 정합니다. 이 방법은 직관적이지만 과적합의 위험이 있습니다. 이전 시기를 너무 완벽하게 맞추려다 잡음까지 흉내 내면 이후의 예측이 오히려 왜곡됩니다. 그래서 합성통제 실무에서는 과적합 편향을 경계하고, 결과의 해석 가능성과 검증(플라시보) 절차를 갖추라는 원칙이 제안돼 있습니다 (arXiv:2203.06279). 최근에는 처치 대상이 여럿인 고차원 상황으로도 확장돼, 코로나19 자택대기 명령이 미국 카운티별 실업률에 미친 효과를 추정하는 데 쓰였습니다 (arXiv:2510.22828).

네 설계 비교표. 이중차분은 처치군과 대조군의 전후 변화 차이를 비교하며 평행추세 가정 위에 서고, 사전 추세가 평평해도 증명은 아닙니다. 도구변수는 도구가 밀어낸 처치 변동의 파급을 보며 관련성과 배제 제약 위에 서고, 추정치는 순응자 효과입니다. 회귀불연속은 임계값 바로 위아래를 비교하며 연속성 가정 위에 서고, 국소적이며 조작에 취약합니다. 합성통제는 처치 대상 하나와 여러 대조의 가중조합을 비교하며, 사전 적합이 좋아도 이후에 이어진다는 보장이 없어 과적합과 검증을 따져야 합니다. 순위 없음.

흔한 오해와 한계 — 도구는 가정 위에 서 있다

여기까지 보면 네 설계가 실험을 완벽히 대체하는 마법처럼 들릴 수 있습니다. 이 도구들의 진짜 미덕은 '증명'에 있지 않습니다. 각 설계는 데이터만으로는 확정할 수 없는 가정 위에 서 있고, 그 가정을 투명하게 드러내는 데 정직함이 있습니다. 아래는 실무자들이 실제로 자주 걸려 넘어지는 함정입니다.

① 평행추세는 검정이 아니라 가정입니다. 평행추세는 '정책이 없었다면 두 집단이 나란히 갔을 것'이라는 반사실에 관한 진술입니다. 그 반사실은 결코 관측되지 않으므로 원리상 직접 검증할 수 없습니다 (arXiv:2510.26470). 연구자들은 흔히 정책 이전 시기의 추세가 평행했는지 보고 안심하지만, 이는 정황일 뿐 보증이 아닙니다. 평행추세는 척도에 따라 달라지기도 합니다. 결과를 원래 값으로 볼 때는 평행하다가 로그(곱셈 단위로 바꾼 값)로 바꾸면 평행하지 않을 수 있습니다. 같은 데이터라도 어떤 척도에서 보느냐에 따라 평행추세 가정이 성립하기도 안 하기도 한다는 뜻입니다 (arXiv:2010.04814). 인과 다이어그램(변수 사이의 원인-결과 화살표를 그린 그림)을 이용해 평행추세를 사전에 기각할 수 있는 조건을 정리한 연구도 있습니다. 처치가 과거 결과의 영향을 받는 경우가 한 예입니다 (arXiv:2505.03526). 결국 평행추세를 정당화하는 일의 중심은 처치가 어떻게 배정됐는가(선택 메커니즘)에 대한 논증이며, 그 논증을 데이터로 벤치마킹하는 전략도 제안돼 있습니다 (arXiv:2203.09001).

② 이벤트 스터디의 사전 추세 검정에는 함정이 있습니다. '정책 이전 점들이 평평한지'를 통계적으로 검정한 뒤, 통과하면 안심하고 분석을 이어가는 관행이 널리 퍼져 있습니다. 그런데 이 사전 검정 자체가 이후의 추정과 추론을 왜곡할 수 있습니다. 최근 연구들은 이런 예비 검정이 낮은 검정력(있는 위반을 잡아내는 힘이 약함), 편향, 신뢰구간의 과소 포함(undercoverage, 신뢰구간이 참값을 담는 비율이 표시된 수준보다 낮음)을 낳는다고 지적하고, 이를 극복하는 절차를 제안했습니다 (arXiv:2510.26470). 더 근본적으로, 기존 방식의 이벤트 스터디 플롯은 평행추세나 '무예측(no-anticipation, 정책 시행 전에 사람들이 미리 반응하지 않는다는 가정)'이 깨지면 정직한 인과 추론을 줄 수 없다는 지적이 있습니다. 이를 보완해 플롯 자체를 엄밀한 추론 도구로 만들려는 방법도 제안됐습니다 (arXiv:2512.06804).

③ 시차 도입에서 이원고정효과(TWFE) 회귀가 편향될 수 있습니다. 이원고정효과 회귀는 집단별·시점별 기본 수준 차이를 각각 통제하는 회귀입니다. 정책이 집단마다 다른 시점에 도입되는 흔한 상황에서 오랫동안 표준으로 쓰였는데, 이 회귀가 인과 효과를 왜곡할 수 있음이 최근 드러났습니다. 회귀계수는 각 집단·시점의 평균처치효과들을 가중합한 값이고, 그 가중치 중 일부가 음수일 수 있습니다. 그러면 모든 집단에서 진짜 효과가 양(+)인데도 회귀계수는 음(−)으로 나오는 황당한 일이 벌어질 수 있습니다 (arXiv:1803.08807). 한 서베이는 문제의 규모를 이렇게 요약합니다. 2015~2019년 《미국경제리뷰(AER)》 최다 피인용 논문 100편 중 26편이 이런 회귀를 쓰고 있었고, 효과가 집단·시점에 따라 다를 때 이 회귀가 오도된 추정치를 낼 수 있다는 것입니다 (arXiv:2112.04565). 이후 이질적 효과(집단·시점마다 다른 효과)에 강건한 대안 추정량이 쏟아졌습니다. 이벤트 스터디를 '결측 채우기'로 보는 대체 추정량이 한 예입니다 (arXiv:2108.12419). 이 대안도 공짜는 아닙니다. 종종 분산이 커서 많은 응용에서 검정력이 떨어지므로 편향과 분산 사이의 저울질이 남습니다 (arXiv:2503.05125). 이 논의의 상당수는 아직 활발히 오가는 프리프린트 단계의 방법론이므로, 정착된 정설이 아니라 진행형 개선으로 읽는 편이 정직합니다.

④ IV의 아킬레스건은 약한 도구와 배제 위반입니다. 도구변수의 두 가정 모두 취약합니다. 도구가 처치를 약하게만 움직이면(약한 도구) 통상의 추론이 어려워지는 것으로 알려져 있고, 약한 도구가 여럿일 때의 검정법이 별도로 연구돼 있습니다 (arXiv:2604.15437). 더 근본적인 위험은 배제 제약입니다. 도구가 처치가 아닌 다른 경로로 결과에 새어 나가면 추정이 오염되는데, 이 가정은 대개 데이터로 직접 검증할 수 없습니다. 처치가 연속변수일 때는 도구의 타당성을 원리상 검정할 수 없음이 증명돼 있습니다. 다만 관측변수 사이의 연속성 같은 약한 구조 가정을 두면 검정 가능성이 이론적으로 회복될 수 있습니다 (arXiv:1806.09517). 흔히 쓰는 위조 검정(falsification test, 가정이 틀렸다면 나타날 흔적을 일부러 찾아보는 검정)도 완벽하지 않아서, 타당한 도구를 두고도 문제가 있다고 잘못 짚어낼 수 있습니다 (arXiv:2312.15624). 결국 배제 제약은 통계가 아니라 논증으로 방어해야 합니다.

⑤ LATE는 '순응자'의 효과입니다. 앞서 봤듯 IV가 주는 값은 도구에 반응한 순응자에 대한 효과(LATE)이고, 이들이 전체 인구를 대표한다는 보장은 없습니다. 자료가 군집(cluster, 같은 학교나 지역처럼 묶이는 단위) 구조를 갖고 군집마다 효과가 다르면 해석이 더 미묘해집니다. 이때 군집 표시를 넣은 2단계 추정은 군집별 LATE들의 가중평균을 주지만, 표준 2SLS는 일반적으로 그런 가중평균조차 식별하지 못합니다 (arXiv:2601.13507). 직업훈련 프로그램의 효과를 민감도 분석(빠뜨린 변수가 결과를 얼마나 흔들 수 있는지 따져 보는 분석)으로 재검토한 연구에서는, 프로그램 효과가 여성에게는 견고했지만 남성에게는 취약했습니다 (arXiv:2604.03544). '누구에 대한, 얼마나 튼튼한 효과인가'는 곁가지 물음이 아닙니다.

⑥ RDD는 국소적이고 조작에 취약합니다. RDD가 식별하는 것은 임계값 바로 근처의 효과입니다. 합격선이 60점일 때, 그 결과가 30점이나 90점인 사람에게도 적용된다는 보장은 없습니다(국소성). 또 하나의 위험은 조작입니다. 임계값이 널리 알려져 있고 그 처치가 값진 것(정부 혜택 등)이라면, 사람들이 러닝 변수를 임계값 너머로 밀어붙일 수 있습니다. 그러면 '양옆이 거의 같다'는 전제가 무너집니다. 이런 전략적 행동에 대응하는 방법이 별도로 연구될 만큼 실제적인 위협입니다 (arXiv:2507.12693).

⑦ 외적 타당도: 여기서 참인 것이 저기서도 참인가. 자연실험은 특정한 시간·장소·집단에서 얻은 결과이므로, 다른 맥락으로 일반화되는지(외적 타당도)는 또 다른 문제입니다. 한 연구는 앵그리스트와 에번스의 유명한 자연실험(형제의 성별 구성이 출산과 노동공급에 미치는 효과)을 세계 여러 나라의 인구총조사 자료로 100번 넘게 복제했습니다. 이 복제 자료를 이용해, 다른 맥락에서의 처치효과를 예측할 때 생기는 오차의 원인을 분해했습니다. 이 복제 자료(출산·노동공급 효과)에서는 오차를 줄이는 데 미시적 조건보다 거시적(국가·시대) 조건이 더 중요했습니다 (arXiv:1906.08096). 한 곳에서 정밀하게 추정된 효과라도 다른 곳에 옮기려면 신중해야 합니다.

마무리 — 묻는 규율

이 글의 제목은 실험 없이 인과를 '증명하는' 법이 아니라 '묻는' 법입니다. 가정이 성립한다면 인과 효과가 식별되지만, 그 가정은 데이터로 확인되지 않기 때문입니다. 그래서 이중차분·도구변수·회귀불연속·합성통제 중 어느 것으로도 인과를 확정하기는 어렵습니다. 사전 추세나 위조 검정 같은 간접 점검은 할 수 있지만 가정 자체를 증명해 주지는 못합니다. 이중차분은 평행추세, 도구변수는 배제 제약, 회귀불연속은 연속성에 기대고, 이 가정이 무너지면 결론도 무너집니다. 합성통제는 사전 적합이 좋아도 그 관계가 처치 이후에도 이어진다는 보장이 없어서, 과적합과 검증 절차를 따져야 합니다.

바로 거기에 이 도구들의 진짜 힘이 있습니다. 이들은 '무엇을 가정하고 있는가'를 명시적으로, 반증 가능하게 드러내도록 강제합니다. 좋은 인과추론 논문은 식별 가정을 숨기지 않고 앞에 내걸고, 그 가정이 그럴듯한 이유를 논증하고, 가정이 흔들릴 때 결론이 얼마나 버티는지를 함께 보고합니다. 상관을 인과라 우기는 대신 '이런 가정 아래에서라면 이것이 인과'라고 정직하게 말하는 것입니다. 인과추론은 완벽한 증명의 기술이 아니라 가정을 투명하게 드러내는 규율입니다.

이제 어떤 실증 논문을 펼치든 첫 질문은 하나로 모입니다. "저자는 무엇을 무엇과 비교하고 있으며, 그 비교가 '거의 무작위'라고 믿을 근거는 무엇인가?" 이 물음을 던질 수 있다면 이미 데이터를 인과의 눈으로 읽기 시작한 것입니다.


이 글은 빠르게 발전하며 일부는 여전히 논쟁 중인 방법론 분야를 다룹니다. 인용한 근거의 상당수는 동료심사 전 프리프린트(arXiv)이며, 특히 시차 도입 DiD·이원고정효과를 둘러싼 논의는 정착된 정설이 아니라 진행 중인 방법론 개선입니다. 결론이 바뀔 수 있습니다.

근거 논문 (arXiv)

  • arXiv:2002.00202 — 자연실험의 정의: '거의 무작위' 배정과 무작위 실험의 본질적 차이
  • arXiv:2408.00032 — 사회과학의 근대적 인과추론 방법론 개관(식별 가정·doubly robust ATE)
  • arXiv:2503.13323 — 이중차분(DiD) 실무 지침: 설계 유형과 추정량 조직화 틀
  • arXiv:2512.06804 — 이벤트 스터디 플롯을 정직하게: 함수형 데이터 접근
  • arXiv:2510.26470 — 평행추세 위반 검정의 유효 추론: 사전 검정의 저검정력·편향·과소포함
  • arXiv:2010.04814 — 평행추세는 언제 함수 형태에 민감한가(척도 의존성)
  • arXiv:2505.03526 — 인과 다이어그램으로 평행추세 사전 평가
  • arXiv:2203.09001 — 선택과 평행추세: 선택 메커니즘과 DiD 편향
  • arXiv:1803.08807 — 이질적 처치효과 하의 이원고정효과 추정량(음의 가중치 문제)
  • arXiv:2112.04565 — TWFE와 DiD, 이질적 처치효과 서베이(AER 최다 피인용 26/100편)
  • arXiv:2108.12419 — 이벤트 스터디 설계 재고: 강건·효율 추정('결측 채우기' 대체 추정량)
  • arXiv:2503.05125 — 이원고정효과 회귀를 언제 써도 되나(편향-분산 저울질 검정)
  • arXiv:2405.01463 — 동적 국소평균처치효과(LATE)와 임벤스·앵그리스트(1994) 가정
  • arXiv:2601.13507 — 군집 자료의 2SLS와 LATE: 군집 이질성 하의 가중평균 LATE
  • arXiv:2604.15437 — 잭나이프 도구변수 추론(다수 약한 도구; 유전 변이로 음주→BMI)
  • arXiv:2312.15624 — 도구변수 설계의 음성대조 위조 검정(배제 제약·타당 도구 오탐)
  • arXiv:1806.09517 — 연속 내생변수 하 도구 타당성의 검정 불가능성
  • arXiv:2604.03544 — 비선형 IV의 누락변수편향 정량화(LATE·JTPA·여성 강건/남성 취약)
  • arXiv:2508.03878 — 의과학에서의 회귀불연속(RD) 설계 입문(연속성 가정)
  • arXiv:2006.05504 — 스웨덴 BCG 접종 중단 자연실험의 회귀불연속(코로나19 보호효과 부재)
  • arXiv:2507.12693 — 플라시보 불연속 설계: 러닝 변수 조작·전략적 행동 대응
  • arXiv:2203.06279 — 실전 합성통제: 과적합 편향·해석 가능성·검증 원칙
  • arXiv:2510.22828 — 고차원 분해 자료의 합성통제(코로나19 자택대기명령→카운티 실업률)
  • arXiv:1906.08096 — 자연실험의 외적 타당도(앵그리스트·에번스 100+ 복제, 거시 조건 우세)
📚 심리·사회과학 — 사람을 재는 법
7 / 7
  1. 1.심리학의 재현 위기 — 우리가 믿었던 발견들은 왜 흔들렸나
  2. 2.연구자 자유도와 p-해킹 — 조작 없이도 원하는 결과가 나오는 법
  3. 3.사라지는 효과 — 교과서에 실렸던 발견들은 왜 다시 재면 작아지는가
  4. 4.누구를 재고 있었나 — 심리학이 "사람"이라고 말할 때의 그 사람
  5. 5.스탠퍼드 감옥실험은 무엇을 보여 줬나 — '상황이 악마를 만든다'는 서사에 제기된 비판들
  6. 6.무작위 대조시험은 정말 '황금표준'인가
  7. 7.실험 없이 인과를 묻는 법 — 자연실험과 네 가지 설계
← 이전 글무작위 대조시험은 정말 '황금표준'인가

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.