Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

"연령·성별·BMI 보정"은 무엇을 했나 — 교란과 보정을 읽는 법

"보정했다"는 무엇을 지웠다는 뜻이 아니라, 그 변수를 인과 구조의 어느 자리에 놓았다는 주장입니다. 보정 여부를 가르는 자리는 셋이고, 그 자리는 자료가 아니라 연구자의 지식이 정합니다.

🔬방법론✦AI 생성기초과학 · 2026년 10월 5일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

"연령·성별·BMI 보정"은 무엇을 했나 — 교란과 보정을 읽는 법

논문 결과 옆에 붙은 이 한 줄을 본 적이 있을 것입니다. 연령·성별·체질량지수 보정. 보정은 나이·성별·체질량지수가 같은 사람끼리 비교한 것처럼 계산을 맞추는 일입니다. 이 줄은 대개 "다른 조건을 똑같이 맞췄으니 남은 것은 진짜 효과"라는 뜻으로 읽힙니다.

실제로 무슨 일이 일어나는지 한 사례로 보겠습니다. 질문은 자간전증(임신 중 혈압이 오르는 병)이 조기분만을 얼마나 일으키는가입니다. 자료는 2007~2012년 캘리포니아에서 쌍둥이가 아닌 아기로 태어난 296만 3,888건의 출생 기록입니다 (PMID 29782045). 연구진은 회귀모형 하나를 세웠습니다. 회귀모형은 여러 변수(나이·학력처럼 사람마다 값이 다른 특성)를 한꺼번에 넣고, 각 변수가 결과와 얼마나 관련되는지를 계산하는 식입니다. 이 모형에 자간전증과 함께 이전 조기분만·임신 중 알코올 남용·산모 학력, 그리고 소득과 거주지 같은 산모의 배경 요인을 넣었습니다.

여기까지는 흔한 그림입니다. 모형을 돌리면 표가 하나 나옵니다. 자간전증의 줄 아래로 이전 조기분만·알코올 남용·학력의 줄이 나란히 붙고, 줄마다 계수가 적힙니다. 계수는 그 변수와 결과의 관련 크기를 나타내는 숫자이고, 이 연구에서는 위험비, 곧 그 특성이 있는 쪽과 없는 쪽의 사건 비율을 나눈 값으로 적혔습니다. 이 연구는 그 줄들이 각각 무엇을 잰 값인지를 따로 계산해 봤습니다. 이전 조기분만의 값은 10% 커졌고, 알코올 남용의 값은 23% 줄었고, 산모 학력의 값은 거의 변하지 않았습니다.

같은 표에 나란히 실려 똑같아 보이던 세 숫자가, 사실은 서로 다른 세 종류의 양이었다는 뜻입니다.

이 글이 하려는 말은 한 줄입니다. "보정했다"는 문장은 그 변수를 인과 구조의 어느 자리에 놓았다는 주장입니다. 인과 구조는 어떤 변수가 어떤 변수에 영향을 주는지를 이은 관계도입니다. 보정은 무엇을 깨끗이 지웠다는 보고로 읽히기 쉽지만, 자리를 잘못 고르면 보정은 문제를 고치는 대신 만듭니다.

이 글에서 새로 배울 말은 여섯 개이고, 각 말은 처음 나오는 자리에서 풉니다.

⚠️ 아래 나오는 병과 약과 정책은 전부 숫자를 읽는 법을 보이기 위한 사례입니다. 어떤 치료가 좋고 나쁜지에 대한 판단이 아니고, 각 숫자는 그 연구의 설계와 대상과 시점 안에서만 뜻을 가집니다.


왜 알아야 하나 — 세어 본 사실들

이 문제의 뿌리는 교란입니다. 교란은 원인으로 의심하는 것과 결과 둘 다에 영향을 주는 또 다른 요인 때문에, 실제와 다른 연관이 겉으로 나타나는 일입니다(「먹는 사람이 더 오래 산다면, 그 사람들은 원래 어떻게 달랐을까 — 교란」에서 다뤘습니다). 논문들이 교란을 어떻게 다루는지는 여러 조사가 직접 세어 봤고, 결과는 크게 세 갈래입니다. 아래 숫자는 각 조사가 고른 논문 묶음에 대한 것이고, "논문 일반"에 그대로 옮길 수는 없습니다.

① 교란을 언급은 해도, "신중히 읽으라"까지는 잘 가지 않습니다. 대상은 2011~2012년 영향력이 가장 높은 일반의학·역학·전문 저널에 실린 연구 120편으로, 무작위로 뽑았습니다 (PMID 28943377). 모두 관찰연구, 곧 연구자가 치료나 생활습관을 배정하지 않고 사람들에게 이미 일어난 일을 지켜본 연구입니다. 사람들을 따라가며 사건을 센 코호트 연구와, 병에 걸린 사람과 안 걸린 사람을 모아 과거를 거꾸로 견준 환자-대조군 연구가 섞여 있습니다.

교란을 입에 올린 논문은 적지 않았습니다. 초록이나 고찰에서 교란을 언급한 것이 68편(56.7%), 에둘러 시사한 것이 20편(16.7%)이었고, 언급도 시사도 없는 것은 32편(26.7%)이었습니다. 그러나 교란 때문에 결과를 "신중하게" 읽어야 한다고 쓴 것은 2편(1.7%)뿐이었습니다. 결론부에 교란이나 다른 편향 관련 한계를 적은 것도 4편(3.3%)이었습니다.

저자들의 정리는 이렇습니다. 교란을 언급할 때조차 저자들은 대개 그것이 자기 결과와는 별 상관이 없다고 확신하며, 신중한 해석을 요청하는 일은 드뭅니다. 그러니 한계 절에 "교란"이라는 말이 적혀 있다는 것만으로는, 저자가 결과를 조심해서 읽으라고 말한 것이 아닙니다. 부수 결과도 있습니다. 결과가 교란의 영향을 받았을 수 있다고 적은 논문이 영향받지 않았을 것 같다고 적은 논문보다 오히려 더 많이 인용됐습니다(연 중앙값 6.3회 대 4.0회, P = 0.04). 저자들은 이를 더 조심스럽게 인정하는 것이 인용에서 손해가 되지는 않는다는 뜻으로 적었습니다 (PMID 28943377).

염증성 장질환 관찰연구 160편에서도 그림은 비슷했습니다 (PMID 33296517). 대부분은 교란이나 편향을 줄이는 전략을 실제로 썼습니다(139편, 86.9%). 보정하지 못한 교란 요인을 최소 하나 인정한 논문도 많았습니다(116편, 72.5%). 그러나 그것이 주요 결과에 영향을 줬을지 논평한 것은 60편(37.5%), 신중한 해석을 요청한 것은 7편(4.4%)이었습니다. 이 조사에서도 교란을 언급한 논문일수록 더 많이 인용되는 양의 연관이 있었지만, 신중한 해석을 요청하는 것은 그렇지 않았습니다.

② 보정된 표의 모든 줄을 위험인자로 읽습니다. 위험인자는 병이나 사건이 생길 가능성을 높이는 요인입니다. 앞의 출생 기록 표로 말하면, 자간전증 말고 함께 실린 줄들까지 각각 그 변수의 효과로 읽는 것입니다. 이 읽기는 뒤에서 이름을 붙일 오류이고, 정형외과 연구 193편 가운데 67%(129편)에서 나타났습니다 (PMID 33933587). 대상은 2019년에 많이 인용되던 정형외과 저널 일곱 곳에서, 여러 변수를 함께 넣은 모형의 결과를 표로 실은 연구입니다. 변수를 고른 근거도 약했습니다. 어떤 변수가 무엇의 원인인지를 따져 변수를 넣은 것은 16%(31편)뿐이었고, 35%(67편)는 통계적 방법으로 변수를 골랐습니다.

구강보건 분야도 비슷합니다. 구강보건 저널 4곳의 2013~2018년 관찰연구 421편 가운데 189편(45%)이 같은 문제를 보였습니다 (PMID 33368566). 저자들은 그 정체를 이렇게 적습니다. 한 모형에서 나온 여러 추정치를 같은 표에 실으면, 독자가 그 값들을 전부 같은 방식으로, 흔히 그 변수의 몫 전부를 재는 값으로 읽도록 부추기게 됩니다.

③ 여러 위험인자를 한 모형에 다 넣습니다. 심혈관질환·당뇨·치매의 위험인자 여럿을 다룬 코호트·환자-대조군 연구 162편에서, 70%가 넘는 연구가 모든 위험인자를 한 모형에 넣어 서로 보정했습니다 (PMID 40038753; 2018년 1월~2023년 3월 출판분). 권장되는 방법은 위험인자 하나하나를 각자의 교란 요인으로 따로 보정하는 것입니다. 그렇게 한 것은 10편(6.2%)이었고, 전부 특정 위험인자 몇 개를 겨냥한 연구였습니다. 저자들은 이 관행이 보정을 지나치게 한 데서 오는 편향과 오도하는 추정치로 이어질 수 있으니, 위험인자를 무분별하게 한 모형에 넣지 말자고 결론짓습니다.

큰 그림 — 보정 여부를 가르는 자리는 셋이다

여기서 노출은 원인 후보로 놓은 것(약·습관·병)이고 결과는 우리가 재려는 사건(발병·사망·재입원)입니다. 노출과 결과 말고 제3의 변수가 하나 더 있을 때, 그 변수가 둘과 어떻게 이어져 있는지에 따라 자리가 나뉩니다. 보정 여부를 가르는 자리는 셋입니다. 자리마다 보정해야 하는지, 하면 안 되는지가 달라집니다.

교란변수는 노출에도 영향을 주고 결과에도 영향을 주는 공통 원인입니다. 앞에서 말한, 교란을 일으키는 또 다른 요인이 바로 이것입니다. 여름이면 아이스크림이 많이 팔리고 물놀이 사고도 늡니다. 둘을 함께 늘리는 것은 더위이고, 아이스크림이 사고를 일으키지는 않습니다. 아이스크림을 노출, 사고를 결과로 놓으면 더위가 교란변수입니다. 이런 변수는 보정해야 합니다. 더위가 같은 날들끼리만 비교하면 겉보기 연관은 사라집니다.

매개변수는 노출이 결과에 영향을 주는 경로 위에 있는 변수입니다. 운동을 하면 체중이 줄고 체중이 줄면 혈압이 내려간다고 해 보겠습니다. 체중은 운동과 혈압 사이의 징검다리입니다. 운동이 혈압에 미치는 효과 전부를 알고 싶은데 체중을 보정하면, 체중을 거쳐 가는 몫이 통째로 잘려 나갑니다. 남는 것은 "체중을 안 거치고 내려간 몫"뿐입니다. 그래서 효과 전부를 보려면 매개변수는 보정하면 안 됩니다.

충돌부는 노출과 결과가 둘 다 영향을 주는 변수입니다. 화살표 두 개가 와서 부딪히는 자리라 붙은 이름입니다. 식당을 생각해 보겠습니다. 음식이 맛있거나 목이 좋으면 살아남고, 둘 다 아니면 문을 닫습니다. 살아남은 식당만 모아 놓고 보면 맛과 목 사이에 없던 관계가 생깁니다. 맛이 별로인데도 살아남았다면 목이 좋았다는 뜻이기 때문입니다. 여기서 "살아남았다"가 충돌부입니다. 살아남은 것만 보는 것이 곧 그 변수에 조건을 거는 일이고, 그 변수를 모형에 넣어 보정하는 것도 조건을 거는 일입니다. 충돌부에 조건을 걸면 없던 연관이 생깁니다. (아이스크림·운동·식당은 설명을 위해 우리가 든 예입니다.)

세 칸 인과 다이어그램. 첫 칸은 더위가 아이스크림 판매와 물놀이 사고 둘 다로 화살표를 보내는 교란변수, 둘째 칸은 운동이 체중을 거쳐 혈압으로 가는 경로와 운동에서 혈압으로 곧장 가는 경로가 있는 매개변수, 셋째 칸은 맛과 목이 둘 다 '살아남음'으로 화살표를 보내는 충돌부다.

세 자리 어디에도 속하지 않는 변수도 있습니다. 노출과는 상관없이 결과에만 영향을 주는 변수가 그렇습니다. 뒤에 나올 산모 학력이 그런 경우입니다.

⚠️ 세 자리는 자료를 들여다봐서 구분되지 않습니다. 어떤 변수가 노출보다 앞에 오는지, 경로 위에 있는지, 아래에 있는지는 자료 밖에서, 곧 연구자가 가진 지식에서 옵니다. 그래서 어떤 변수를 넣을지 고르는 일은 인과 구조에 대한 주장이고, 통계 절차만으로 대신할 수 없습니다.

그 주장을 그림으로 옮긴 것이 인과 다이어그램입니다. 인과 다이어그램은 변수들을 놓고 무엇이 무엇에 영향을 주는지를 화살표로 그린 그림입니다. 이 그림에 교란변수·매개변수·충돌부에 대한 가정을 옮겨 두면, 보정할 변수를 고르고 흔한 편향과 교란의 원천을 피하는 데 도움이 됩니다 (PMID 40707288). 그 입문의 저자들은 이 틀을 대규모 무작위 시험의 보완물 또는 대안으로까지 봅니다. 다만 이 그림이 과학적 근거를 주는 것은 변수 선택의 일부 국면입니다 (PMID 36328854). 같은 개관은 변수의 종류와 인과 순서를 무시하고 모형에 넣으면 효과 추정치가 얼마나 심하게 잘못 계산되는지를 프레이밍햄 심장연구 자료로 보입니다.

그림을 그린다고 다 풀리는 것도 아닙니다. 한 이론적 사례에서 표준 인과 다이어그램은 교란과 편향을 완전히 식별하지 못했고, 잘못된 보정변수 묶음을 내놓았습니다 (PMID 35612081). 이 비교를 한 것은 그 한계를 돕는 도구를 만든 저자들 자신이고, 그들도 도구를 더 쓸 만하게 만들려면 추가 연구가 필요하다고 적습니다. 실제로 그림을 그리는 연구도 드뭅니다. 앞의 정형외과 조사에서 인과추론으로 변수를 고른 31편 가운데 이 그림까지 그린 것은 3편이었습니다 (PMID 33933587).

관찰연구에서 이 모든 고민이 필요한 까닭은 무작위배정이 없기 때문입니다. 무작위배정은 누가 어느 군에 들어갈지를 제비뽑기처럼 우연에 맡기는 것입니다. 제비뽑기는 연구자가 떠올리지 못한 차이까지 양쪽에 대체로 고르게 나눕니다. 관찰연구에는 그 장치가 없어서, 어느 변수를 어느 자리에 놓을지를 연구자가 정해야 합니다. 제비뽑기 예시는 「먹는 사람이 더 오래 산다면, 그 사람들은 원래 어떻게 달랐을까 — 교란」에서 다뤘습니다.

기본 원리 — "보정했다"가 실제로 하는 일

보정은 이미 모인 자료 위에서 하는 계산입니다. 모형에 어떤 변수를 넣는다는 것은 그 변수의 값이 같은 사람들끼리 비교한다는 뜻입니다. 이 비교가 인과효과, 곧 노출이 정말로 결과를 바꾼 몫을 준다는 보장은 자료에서 나오지 않고 가정에서 나옵니다. 그 가정은 여러 방식으로 깨지는데, 이 글은 그중 가장 흔한 두 자리를 봅니다. 깨지고 남은 것의 크기를 실제로 잰 연구도 하나 봅니다.

① 안 잰 것은 못 맞춘다 — 미측정 교란

미측정 교란은 교란변수를 아예 재지 않아서 모형에 넣을 수조차 없는 경우입니다. 병원 기록에 흡연 여부가 없으면 흡연을 보정할 방법이 없습니다. 자명해 보이지만 문제는 그 크기입니다.

그 크기는 시뮬레이션으로 잴 수 있습니다 (PMID 17615092). 시뮬레이션은 정답을 미리 정해 둔 가짜 자료를 컴퓨터로 만들어, 분석이 무엇을 내놓는지 보는 방법입니다. 이 연구는 실제로는 노출이 결과에 아무 인과효과가 없도록 자료를 만들었습니다. 노출은 정규분포(가운데가 높은 종 모양 분포)를 따르게 했고, 같은 모양의 교란변수를 두 개 또는 네 개 넣었습니다. 그런 다음 겉보기 연관이 얼마나 커질 수 있는지를 계산했습니다. 교란변수들이 서로 상관되지 않았을 때는 잔여·미측정 교란이 커질수록 치우침도 커졌고, 상관된 경우에는 양상이 더 복잡했습니다.

저자들의 결론은 그럴듯한 가정 아래에서, 관찰역학 연구에서 흔히 보고되는 크기의 효과가 잔여 교란이나 미측정 교란만으로도 만들어질 수 있다는 것입니다. 논문에서 흔히 보는 크기의 연관이라면, 그 크기만 보고는 진짜 효과인지 교란이 만든 것인지 가를 수 없다는 뜻입니다.

② 잘못 잰 것도 못 맞춘다 — 잔여 교란

잔여 교란은 교란변수를 넣긴 넣었는데 거칠게 재거나 잘못 재서, 교란이 다 빠지지 않고 남는 경우입니다. 흡연을 "예/아니오"로만 재면 하루 한 개비와 두 갑이 같은 칸에 들어갑니다.

이렇게 남은 치우침은 방향도 짐작하기 어렵습니다 (PMID 17615092). 노출 쪽 측정오차는 사정이 다릅니다. 노출을 재면서 생긴 오차가 결과와 무관하게 생긴 것이라면, 특정 조건에서 치우침이 영값, 곧 "효과 없음" 쪽으로 간다는 것은 잘 알려져 있습니다. 교란변수의 측정오차는 잔여 교란으로 이어지고, 그 치우침이 어느 쪽을 향할지는 분명하지 않습니다. 다시 말해 "보정했다"는 문장은 그 변수를 정확하게 쟀다는 것까지 함께 주장하고 있습니다.

그래서 보정 뒤에 무엇이 남는가

보정 뒤에 남은 치우침의 크기는 보통 알 수 없습니다. 맞대 볼 정답이 없기 때문입니다. 미국 한 주의 메디케이드(저소득층 공공의료보험)에서는 그 정답이 생겼습니다 (PMID 34978862). 어느 지역 등록자의 3분의 2 이상이 5개 보험플랜 중 하나에 무작위로 배정된 것입니다. 연구자 대신 제도가 제비뽑기를 한 이런 상황을 자연실험이라고 부릅니다. 2013~2014년 등록자 137,933명 가운데 31.1%는 스스로 플랜을 골랐고 68.9%는 무작위 배정됐습니다. 같은 자료 안에 무작위 배정된 사람과 스스로 고른 사람이 함께 있어서, 보정 뒤에 남은 것의 크기를 실제로 잴 수 있었습니다. 예상대로, 플랜마다 등록자의 특성이 뚜렷이 달랐던 것은 스스로 고른 쪽뿐이었습니다.

지출 점수는 한 플랜의 지출이 평균 플랜보다 얼마나 많거나 적은지를 나타냅니다. 같은 플랜의 지출 점수를 두 인구에서 따로 매기자, 평균 등록자당 $67만큼 차이가 났습니다(절댓값 기준, 95% 신뢰구간 $38–$123). 신뢰구간은 참값이 있을 법한 범위입니다. 이 차이는 등록자당 평균 지출의 4.2%였고, 표본의 우연만으로 생겼다고 보기 어려웠습니다(P = 0.009). 환자 구성의 차이를 보정하는 절차를 위험보정이라고 합니다. 위험보정을 적용해도 그 차이는 $62로 소폭 줄어드는 데 그쳤습니다(P = 0.012). 사회적 요인을 추가로 보정해도 추정치는 실질적으로 달라지지 않았습니다. 다른 성과지표 대부분에서도 잔여 교란은 비슷하게 상당했습니다. 저자들의 결론은 위험보정된 성과평가에서 잔여 교란이 상당할 수 있으므로, 정책결정자는 위험보정이 플랜의 실제 성과 차이를 분리해 준다고 가정해서는 안 된다는 것입니다. 한계로는 두 인구 사이에 플랜 효과의 이질성이 있을 가능성을 적었습니다 (PMID 34978862).

세로 막대 두 개. 위험보정 전 67달러(95% 신뢰구간 38~123달러), 위험보정 후 62달러. 보정 뒤에도 차이가 거의 그대로 남아 있다.

보정 전과 후의 막대 높이가 거의 같다는 것은, 등록자 구성에서 온 치우침 가운데 위험보정이 걷어 낸 것이 일부뿐이었다는 뜻입니다.

⭐Table 2 fallacy — 보정변수의 줄까지 효과로 읽는 실수

이 글을 연 캘리포니아 출생 기록 연구로 돌아오겠습니다. 그 모형은 자간전증이 조기분만에 미치는 몫 전부, 곧 어떤 경로를 거치든 자간전증 때문에 생긴 차이를 모두 합친 값을 추정하려고 세운 것이었습니다. 그 모형 안에 함께 실린 계수들은 각각 이런 것이었습니다.

가로 막대 세 줄. 이전 조기분만은 오른쪽으로 10% 커졌고, 알코올 남용은 왼쪽으로 23% 줄었고, 산모 학력은 0 근처에 거의 변하지 않음으로 표시돼 있다.

  • 이전 조기분만의 계수는 모형 안의 다른 변수를 붙잡아 둔 채 본 몫이었습니다. 그 변수를 거쳐 가는 몫이 빠진 값이라, 이전 조기분만의 몫 전부로 다시 추정하자 10% 커졌습니다.
  • 알코올 남용의 위험비는 모형에 넣지 않은 교란변수 때문에 치우쳐 있었습니다. 약물 남용을 보정하자 23% 줄었습니다.
  • 산모 학력의 위험비는 결과를 예측할 뿐 세 자리 어디에도 속하지 않는 변수라 거의 안 변했습니다.

저자들의 결론은 한 모형의 여러 효과 추정치를 함께 보고하면 오해와 재현성 부족으로 이어질 수 있으니, 통계 모형이 추정하는 효과의 종류를 신중히 따져야 한다는 것입니다 (PMID 29782045).

이 함정에는 이름이 있습니다. Table 2 fallacy는 한 모형에서 나온 관심 노출과 보정변수의 추정치를 같은 표에 함께 싣는 관행을 가리키며, 2013년에 붙은 이름입니다 (PMID 33368566). 위험은 그 표가 부르는 읽기, 곧 모든 줄을 같은 종류의 값으로 읽게 만드는 데 있습니다.

이름을 붙인 그 논문은 세 가지 문제를 듭니다 (PMID 23371353). 먼저 용어 하나를 정합니다. 공변량은 관심 대상이라서가 아니라 그 영향을 걷어 내려고 모형에 넣은 변수, 곧 보정변수입니다. 첫째, 공변량에 대해 그 변수를 붙잡아 둔 채 본 몫과 그 변수의 몫 전부를 혼동하게 만듭니다. 앞의 이전 조기분만 줄이 그런 경우입니다. 둘째, 주 노출의 추정치는 교란되지 않았더라도 공변량의 추정치는 교란돼 있을 수 있습니다. 알코올 남용 줄이 그런 경우입니다. 셋째, 노출의 효과가 공변량의 값에 따라 달라지는 이질성 때문에 해석이 더 복잡해집니다. 제안은 한 모형에서 나온 값들이 각각 어떤 종류인지를 정밀하게 구분해 적고, 공변량의 몫 전부가 필요하면 그것을 위한 별도 모형을 쓰라는 것입니다.

보정변수의 줄들은 독립적인 위험인자로 읽히는 일이 잦습니다 (PMID 42531045). 어떤 노출 하나의 효과를 추정하려고 세운 모형도 연령·성별·동반질환·생활습관 같은 보정변수의 계수까지 함께 내놓기 때문입니다. 애초에 그 분석은 그 변수들의 효과를 추정하도록 설계되지 않았는데도 그렇습니다. 2026년의 한 해설은 이렇게 못 박습니다. 보정을 쓰는 것은 문제가 아닙니다. 문제는 보정항 하나하나를 별개의 인과 추정치인 양 해석하는 것입니다. 권고는 넷입니다. 그 분석이 재려는 값이 정확히 무엇인지와 노출이 무엇인지를 명시합니다. 가정한 인과 구조에서 보정변수를 고릅니다. 노출의 계수만 해석합니다. 추가 질문마다 별도의 모형을 적합합니다. 그리고 마지막 두 문장이 이 절의 요약입니다. 회귀표는 수정 가능한 위험의 메뉴가 아닙니다. 어떤 연관이 임상적으로 행동 가능한 것은 연구가 그 해석을 뒷받침하도록 설계됐을 때뿐입니다 (PMID 42531045).

같은 함정이 사회경제적 지위(학력·직업·소득으로 재는 사회적 형편) 연구에서는 '상호보정 오류'라는 이름으로 나타납니다 (PMID 30606167). 학력·직업·소득을 한 모형에 넣어 서로 보정한 뒤, 각 계수를 똑같이 그 지표의 "독립적" 효과로 읽는 관행입니다. 학력이 직업으로 이어지고 학력과 직업이 함께 소득을 결정한다고 가정해 보겠습니다. 그러면 학력의 계수는 직업이나 소득을 거치지 않는 몫만 나타내고, 소득의 계수는 학력과 직업의 교란을 걷어 낸 몫을 나타냅니다. 세 계수는 각각 다른 경로를 뺀, 다른 종류의 양입니다. 셋을 나란히 놓고 비교하는 것은 같은 것끼리 비교하는 것이 아닙니다. 다만 이 논문은 반대쪽 절반도 적습니다. 상황에 따라서는 더 멀리 있는 지표(학력·직업)를 보정하는 것이 재지 못한 사회경제적 교란을 차단하기에 충분할 수 있습니다. 그러면 더 가까운 지표(소득)의 보정 추정치에 대한 인과적 확신은 오히려 높아질 수 있습니다.

여러 예측변수 가운데 무엇이 중요한지가 정말 궁금한 연구도 있습니다. 원인을 밝히기보다 기술이 목적인 이런 연구에는 맞는 방법론이 부족했고, 그것이 이 오류로 이어지는 일이 잦았습니다 (PMID 37444042). 같은 논문은 대안으로 다섯 단계의 기계학습 틀을 제안하고, 그 강점과 약점을 함께 논합니다.

흔한 오해

① "보정했으니 인과다"

보정만으로 인과효과를 얻으려면 맞춰야 할 변수를 다 재고, 제대로 재고, 맞춰도 되는 자리에 있는 것만 골라 넣어야 합니다. 안 잰 것이 있으면 깨지고 잰 것을 거칠게 쟀어도 깨지는데, 그것만으로 관찰역학에서 흔히 보고되는 크기의 효과가 만들어질 수 있습니다 (PMID 17615092). 무작위배정과 나란히 재 본 자연실험에서는 위험보정이 잔여 교란을 소폭밖에 줄이지 못했습니다 (PMID 34978862). 편향과 교란은 참 관계가 인과가 아닐 때에도 통계적으로 유의한 연관이 나타나는 흔한 잠재적 설명입니다 (PMID 28817531).

그래도 관찰연구에서 인과를 말할 길은 있습니다. JAMA를 비롯한 많은 의학 저널은 인과 언어를 무작위시험 보고에만 허용해 왔습니다. 이 관행을 다시 검토한 2024년 논문은 잘 수행된 무작위 임상시험이 인과 질문에 답하는 선호되는 방법이라는 점을 그대로 둡니다. 그 위에서, 관찰연구 방법론이 발전해 강한 가정이 성립할 때는 잘 수행된 관찰연구 결과의 인과적 해석이 가능할 수 있다고 적습니다. 어떤 질문에는 관찰연구가 실질적으로 유일한 정보원이고, 실제 진료를 반영하는 인구와 상황을 다룰 수 있으며, 이후 실험으로 검증할 개입을 찾는 데 쓸 수 있다는 것입니다. 제안은 여섯 개의 핵심 질문으로 된 틀입니다 (PMID 38722735).

② "변수를 많이 넣을수록 안전하다"

정반대일 수 있습니다. 매개변수를 넣으면 경로 위의 몫이 잘려 나가고, 충돌부를 넣으면 없던 연관이 생깁니다. 이런 일은 드물지 않았습니다. 여러 위험인자를 다룬 연구 162편 중 권장 방법을 쓴 것은 10편(6.2%)이었고, 70%가 넘는 연구가 모든 위험인자를 한 모형에 넣어 서로 보정했습니다 (PMID 40038753). 정형외과 저널 193편 조사에서는 35%(67편)가 통계적 방법으로 변수를 골랐습니다 (PMID 33933587).

넣어야 할 것은 교란변수입니다. 교란변수는 다른 공변량과 마찬가지로 찾아내고, 재고, 보정해야 하는 변수입니다 (PMID 38524951).

권장되는 방향은 가정한 인과 구조에서 변수를 고르는 것입니다 (PMID 42531045).

③ "'연관'이라고 썼으니 안전하다"

목표는 실질적으로 인과인데 문장만 연관의 언어로 쓰는 논문이 흔합니다 (PMID 34535799). 2014~2018년 일반역학 상위 5개 저널 논문 100편을 무작위로 뽑아, 목표·분석방법·해석이 서로 맞물려 있는지(정렬돼 있는지)를 본 조사입니다. 명시적으로 인과를 내건 것은 13편(13%), 연관의 언어로 틀지었지만 실질적으로 인과를 겨냥한 것은 71편(69%)이었습니다.

셋이 완전히 정렬된 것은 9편(9%)이었습니다. 명시적으로 인과를 표방한 쪽이 더 자주 정렬돼 있었습니다(13편 중 5편 38% 대 71편 중 3편 4%). 어긋남도 흔했습니다. 목표와 방법이 어긋난 것은 103건의 판정 중 34건(33%), 목표와 해석이 어긋난 것은 32편(31%)이었습니다. 다만 목표와 방법을 견준 판정에서 가장 흔했던 것은 "방법 보고가 부족해 판단할 수 없음"(47편, 46%)이었습니다. 그리고 목표와 해석의 어긋남은 방법이 정렬된 연구에서 덜 나타났습니다(2편 2% 대 13편 13%).

한 논평은 이 관행을 정면으로 비판합니다 (PMID 29565659). 저자와 편집자가 연구의 인과적 목표를 명시하기를 꺼리고, 인과효과 추정치를 연관 추정치라고 부른다는 진단입니다. 그 위에서 이 논평은 "인과"라는 말을 쓰는 것이 관찰연구의 질을 높이는 데 필요하다고 주장합니다. 인과적 목표를 분명히 밝히면 과학적 질문의 모호함과 자료 분석의 오류와 결과 해석의 과잉이 준다는 것입니다.

더 깊이 가려면

이 글이 세운 것은 자리 세 개의 이름과, 보정이 무엇을 하고 무엇을 못 하는지입니다. 그 위에 서는 두 주제는 다른 편이 맡습니다.

  • 보정하면 안 되는 것을 보정하면 무슨 일이 벌어지나 — 매개변수를 보정해 답의 방향이 뒤집힌 사례, 충돌부에 조건을 걸어 없던 연관이 생긴 사례, "충돌부 편향이 그 역설을 설명한다"는 말에 제동을 건 연구들. 「보정하면 안 되는 것 — 어떤 변수는 넣는 순간 답이 바뀐다」의 몫입니다.
  • 보정 뒤에 남은 것을 어떻게 재나 — E-value, 음성대조, 적응증에 의한 교란, 성향점수, 무작위시험에서도 하는 공변량 보정. 「보정을 다 하고 나서 남는 것 — E-value·음성대조·성향점수가 하는 일과 하지 않는 일」의 몫입니다.

이 글의 범위 안에서 한 걸음 더 가려면, 어떤 편향이 어떤 설계에서 자주 생기는지를 유형별로 그린 지도부터 보면 좋습니다 (PMID 32133725). 나머지 읽을거리는 아래 근거 논문에 종류별로 묶어 뒀습니다.


이 글이 남기려는 것은 읽기 규칙 하나입니다. "보정했다"는 문장을 만나면, 그 변수가 어느 자리에 있는지를 묻습니다. 무엇을 보정했는지 목록만 보고 넘어가지 않습니다. 보정 여부를 가르는 자리는 셋이었습니다. 노출보다 앞에 있는 공통 원인이면 보정이 옳고, 노출과 결과 사이에 있으면 보정은 답을 바꾸고, 노출과 결과가 둘 다 영향을 준 변수라면 보정은 없던 답을 만듭니다.

그리고 표에 나란히 실린 다른 줄들, 곧 연령·성별·체질량지수의 계수는 그 연구가 답하려던 질문의 답이 아닙니다.

이 규칙이 "관찰연구를 믿지 마라"로 읽히면 이 글은 실패한 것입니다. 읽는 사람이 할 일은 하나입니다. 어떤 변수가 왜 그 자리에 놓였는지를 논문이 말해 주는지 확인하는 것입니다. 말해 주지 않는다면 그 보정이 무엇을 했는지는 아직 알 수 없습니다.

근거 논문

세어 본 사실

  • "Interpretation of epidemiologic studies … consideration of confounding." (2018) — PMID 28943377 — 고영향 저널 코호트·환자-대조군 120편(2011~12). 교란 언급 68편(56.7%). "신중히" 2편(1.7%), 결론부 한계 4편(3.3%). 영향을 인정한 논문이 오히려 더 많이 인용됨(연 중앙값 6.3 대 4.0회, P = 0.04).
  • "Confounding and bias in observational studies in IBD…" (2021) — PMID 33296517 — 관찰연구 160편. 교란 언급 67편(41.9%), 완화 전략 139편(86.9%), 보정 못 한 교란 인정 116편(72.5%), 결과 영향 논평 60편(37.5%), 신중 해석 요청 7편(4.4%). 교란 언급은 인용수와 양의 연관(P = 0.010), 신중 해석 요청은 아님. 보고는 환자-대조군·비일상수집·실험실 평가·비가변 노출에서 특히 부실.
  • "Multivariable models in orthopaedic research…" (2021) — PMID 33933587 — 2019년 IF 상위 7개 정형외과 저널 193편. Table 2 fallacy 67%(129편), 인과추론 기반 변수 선택 16%(31편, 그중 다이어그램 3편), 통계적 방법 35%(67편). 저자 결론은 이런 문제를 줄이려면 통계 교육과 지식이 더 필요해 보인다는 것.
  • "A scoping review of Table 2 fallacy in the oral health literature." (2021) — PMID 33368566 — 구강보건 저널 4곳 421편 중 189편(45%). 2013년에 붙은 이름. 독자가 모든 값을 같은 방식으로, 흔히 그 변수의 몫 전부로 읽게 부추긴다는 것이 문제.
  • "Confounder adjustment … multiple risk factors…" (2025) — PMID 40038753 — 심혈관·당뇨·치매 다중 위험인자 연구 162편(2018~23). 권장 방법 10편(6.2%), 전부 특정 인자를 겨냥한 연구. 상호보정 70% 초과. 무분별한 일괄 투입을 피하라는 결론.
  • "Is the Way Forward to Step Back?…" (2022) — PMID 34535799 — 일반역학 상위 5개 저널 100편(2014~18). 명시적 인과 13편(13%)·연관 언어 71편(69%), 완전 정렬 9편(9%). 목표-방법 34/103(33%), 목표-해석 32편(31%), 판단 불가 47편(46%). 목표-해석 어긋남은 방법이 정렬된 쪽에서 덜함(2% 대 13%).

개념과 용어

  • "Confounding by Indication, Confounding Variables, Covariates…" (2024) — PMID 38524951 — 독립변수 ⊃ 공변량 ⊃ 교란변수. 공변량은 관심 대상이어서가 아니라 영향을 걷어 내려고 넣는 것.
  • "Bias, Confounding, and Interaction…" (2017) — PMID 28817531 — 개관. 무작위로 나뉜 군들에서 교란이 대체로 문제되지 않는 이유, 관찰연구에서 무시하면 왜곡되는 일이 잦다는 것, 편향·교란이 유의한 연관의 흔한 잠재적 설명이라는 것.
  • "Where to look for the most frequent biases?" (2020) — PMID 32133725 — 선택 편향·정보 편향의 유형별 지도. 각 편향이 어떤 설계에서 가장 자주 생기는지와 예방책.
  • "The C-Word: Scientific Euphemisms Do Not Improve Causal Inference…" (2018) — PMID 29565659 — "인과"라는 말을 쓰는 것이 관찰연구의 질을 높이는 데 필요하다는 논평. 질문의 모호함·분석 오류·해석 과잉이 줍니다.
  • "Causal Inference About the Effects of Interventions From Observational Studies…" (2024) — PMID 38722735 — 잘 수행된 무작위시험이 여전히 선호되는 방법이라는 전제 위에서, 강한 가정이 성립할 때는 관찰연구의 인과적 해석이 가능할 수 있다고 봅니다. 여섯 핵심 질문의 틀.

인과 다이어그램

  • "DAGs for dummies: how to extract causation from correlation." (2025) — PMID 40707288 — 입문. 교란변수·매개변수·충돌부 가정을 그려 보정 변수를 고르게 합니다. 저자들은 이 틀을 대규모 무작위 시험의 보완물 또는 대안으로 봅니다.
  • "Using Causal Diagrams for Biomedical Research." (2023) — PMID 36328854 — 관찰연구·임상시험 양쪽에 쓰이며 변수 선택의 일부 국면에 과학적 근거를 줍니다. 프레이밍햄 자료로 오계산 예시.
  • "OntoBioStat: Supporting Causal Diagram Design and Analysis." (2022) — PMID 35612081 — 표준 인과 다이어그램만으로는 교란·편향이 완전히 식별되지 않고 잘못된 공변량 집합이 나올 수 있습니다(이론적 사례). 도구는 추가 연구가 필요하다고 저자들이 적습니다.

Table 2 fallacy

  • "The table 2 fallacy…" (2013) — PMID 23371353 — 원전. 공변량의 직접효과·총효과 혼동, 주 노출이 교란되지 않아도 공변량 추정치는 교란될 수 있음, 이질성. 제안은 종류의 구분과 별도 모형.
  • "Interpreting multivariable regression coefficients …: The Table 2 fallacy." (2026) — PMID 42531045 — 문제는 보정이 아니라 보정항을 별개 인과 추정치로 읽는 것. 권고 넷. "회귀표는 수정 가능한 위험의 메뉴가 아니다."
  • "Revisiting the Table 2 fallacy: … preeclampsia and preterm birth." (2018) — PMID 29782045 — 캘리포니아 단태 출생 2,963,888건(2007~2012). 한 모형의 계수 셋이 각각 다른 종류였음을 같은 자료로 계산해 보인 예제.
  • "Interpreting mutual adjustment for … socioeconomic position…" (2019) — PMID 30606167 — 학력→직업, 학력·직업이 함께 소득을 결정하는 가정에서 세 계수는 종류가 달라 직접 비교 불가. 다만 더 먼 지표의 보정이 미측정 사회경제 교란을 막기에 충분할 수 있어, 더 가까운 지표의 확신을 오히려 높일 수 있습니다.
  • "Table 2 Fallacy in Descriptive Epidemiology…" (2023) — PMID 37444042 — 기술이 목적인 연구용 기계학습 다섯 단계 틀. 저자들이 강점과 약점을 함께 논합니다.

미측정·잔여 교란

  • "The impact of residual and unmeasured confounding…" (2007) — PMID 17615092 — 정규분포 교란변수 두 개 또는 네 개. 그럴듯한 가정 아래 관찰역학에서 흔한 크기의 효과가 교란만으로 생길 수 있습니다. 교란변수의 측정오차는 방향 불분명한 잔여 교란을 낳음.
  • "Residual Confounding in Health Plan Performance Assessments…" (2022) — PMID 34978862 — 메디케이드 자연실험 137,933명(자가 선택 31.1% / 무작위 배정 68.9%). 지출 점수 차 절댓값 $67(95% CI $38–$123, 평균의 4.2%)이 위험보정 후 $62로 소폭 감소. 다른 지표 대부분도 비슷. 한계는 두 인구 간 플랜 효과 이질성.
📚 논문 통계 읽기 — p값부터 메타분석까지
8 / 16
  1. 1.p=0.03은 무엇의 확률인가 — p값이 답하는 하나의 질문
  2. 2.0.05는 어디서 왔나 — 유의성이 몇 명에 달려 있는지 세는 법
  3. 3.신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법
  4. 4.오즈비는 위험비가 아니다 — '몇 배'가 무엇의 몇 배인가
  5. 5.어떤 연구는 위험을 셀 수 없다 — 설계가 지표를 정하고, 층을 합치면 값이 달라진다
  6. 6."위험 50% 감소"는 몇 명인가 — 상대위험·절대위험·NNT를 읽는 법
  7. 7.같은 결과, 다른 문장 — 형식이 판단을 바꾸는 자리와 바꾸지 못하는 자리
  8. 8."연령·성별·BMI 보정"은 무엇을 했나 — 교란과 보정을 읽는 법
  9. 9.보정하면 안 되는 것 — 어떤 변수는 넣는 순간 답이 바뀐다
  10. 10.보정을 다 하고 나서 남는 것 — E-value·음성대조·성향점수가 하는 일과 하지 않는 일
  11. 11.해저드비 0.7은 무엇의 0.7인가 — 생존곡선 읽는 법
  12. 12.그 사람들은 언제부터 세어졌나 — 관찰연구가 효과를 만들어내는 방식
  13. 13.끝까지 따라가지 못할 때 — 치료를 바꾼 사람, 다른 이유로 떠난 사람
  14. 14.메타분석은 평균을 내지 않는다 — 숲그림의 마름모가 만들어지는 법
  15. 15.I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법
  16. 16.같은 시험, 다른 결론 — 출판편향과 "무엇을 합쳤는가"
← 이전 글같은 결과, 다른 문장 — 형식이 판단을 바꾸는 자리와 바꾸지 못하는 자리다음 글 →보정하면 안 되는 것 — 어떤 변수는 넣는 순간 답이 바뀐다

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.