
Paperis 아티클
어떤 연구는 위험을 셀 수 없다 — 설계가 지표를 정하고, 층을 합치면 값이 달라진다
논문이 오즈비를 쓰는 것은 게을러서가 아닙니다. 환자-대조군 연구에서는 각 군의 위험을 셀 수가 없습니다 — 사례와 대조를 몇 명씩 넣을지 연구자가 정했기 때문입니다. 그리고 오즈비에는 다른 지표에 없는 성질이 하나 더 있습니다.
어떤 연구는 위험을 셀 수 없다 — 설계가 지표를 정하고, 층을 합치면 값이 달라진다
조현병이 있는 여성은 유방암 검진을 덜 받고, 유방암에 더 많이 걸리고, 유방암으로 더 많이 죽는다는 근거가 있습니다. 조현병이 없는 여성이나 일반 인구에 견줬을 때 그렇습니다. 항정신병약 중에서도 프로락틴이라는 호르몬을 올리는 약이 그 위험을 높인다는 의심도 오래 있었습니다. 그래서 핀란드에서 전국 규모의 연구가 이루어졌습니다. 연구자들은 유방암 진단을 받은 조현병 여성과 받지 않은 여성을 각각 모은 뒤, 두 무리가 과거에 어떤 약을 얼마나 오래 썼는지 거슬러 비교했습니다. 이렇게 결과가 이미 일어난 사람과 일어나지 않은 사람을 따로 모아 두고 과거를 조사하는 설계를 환자-대조군 연구라고 부릅니다. 지금 아픈 사람에게 "그동안 무엇을 하셨습니까"를 묻는 쪽입니다.
유방암 진단을 받은 여성 쪽에서, 프로락틴을 올리는 약에 5년 넘게 노출됐던 오즈가 1년 미만 노출에 견주어 통계적으로 유의하게 높았습니다. 오즈는 어떤 일이 일어난 사람 수를 일어나지 않은 사람 수로 나눈 값입니다. 프로락틴을 올리지 않는 약에서는 유의한 차이가 없었습니다.
이 연구를 오즈비 해석의 관점에서 따져 본 논평은 결과 자체를 부정하지 않습니다. 다만 저자는 이 설계와 결과로는 프로락틴을 올리지 않는 약이 올리는 약보다 유방암 위험이 낮은지를 독자가 판단할 수 없다고 결론짓습니다. 그리고 유방암 위험과 별개로, 프로락틴이 올라갈 때 따라오는 다른 부작용은 잘 알려져 있으므로 그것을 피하거나 관리하는 것은 바람직하다는 문장을 함께 둡니다 (PMID 34813689).
이 연구가 '위험이 몇 배'가 아니라 '오즈가 몇 배'를 보고한 데는 까닭이 있습니다. 이 설계에서는 위험을 셀 수가 없습니다. 여기서 위험은 정해진 기간에 사건을 겪은 사람의 비율입니다.
두 집단의 오즈를 나눈 값이 오즈비이고, 두 집단의 위험을 나눈 값이 위험비입니다. 두 값이 어떻게 다른지는 「오즈비는 위험비가 아니다 — '몇 배'가 무엇의 몇 배인가」에서 다뤘습니다. 이 글은 그다음 두 가지를 다룹니다. 첫째, 설계가 낼 수 있는 지표를 정한다는 것입니다. 둘째, 오즈비에는 다른 지표에 없는 성질이 하나 더 있습니다. 나이나 체질처럼 한 가지 기준으로 나눈 부분 집단을 층이라고 하는데, 오즈비는 층마다 값이 같아도 전체를 합치면 값이 달라집니다.
새로 배울 말은 여섯 개이고, 처음 나오는 자리에서 풉니다.
⚠️ 아래 나오는 병과 약과 수치는 전부 숫자를 읽는 법을 보이기 위한 사례입니다. 어떤 치료가 좋고 나쁜지에 대한 판단이 아니고, 각 숫자는 그 연구의 설계와 대상 안에서만 뜻을 가집니다.
설계가 지표를 정한다
여기서 지표는 두 집단의 차이를 숫자 하나로 나타낸 값, 곧 위험비나 오즈비 같은 것을 말합니다. 연구가 무엇을 관찰했는가가 그 연구에서 어떤 지표를 계산할 수 있는지를 정합니다.
따라가며 세는 설계 — 코호트 연구와 무작위 시험
코호트 연구는 사람들을 미리 나눠 놓고 시간을 따라가며 결과를 세는 설계입니다. 흡연자 1,000명과 비흡연자 1,000명을 10년 지켜보며 병이 몇 명에게 생기는지 세는 식입니다. 누가 어느 군에 들어갈지를 동전 던지듯 우연에 맡기면 무작위 시험이 됩니다. 두 설계 모두 각 군의 위험을 직접 셀 수 있습니다. 1,000명 중 80명에게 병이 생겼다면 위험은 8%입니다.
그런데도 코호트 연구와 무작위 시험이 오즈비를 보고하는 일이 흔합니다. 오즈비를 꼭 써야 하는 설계는 몇 안 됩니다. 오즈비가 널리 쓰이는 까닭은 로지스틱 회귀에 있습니다. 로지스틱 회귀는 결과가 예·아니오로 나뉘는 자료에 널리 쓰이는 통계 모형이고, 계산 결과로 오즈비를 내놓습니다. 대안은 위험비를 곧장 계산해 주는 이항 회귀입니다. 결과가 흔한 코호트를 다룬 이 논문의 예제 자료에서 오즈비는 위험비를 두 배 넘게 부풀렸습니다. 저자들의 결론은 코호트 연구에서 로지스틱 회귀를 크게 줄여야 한다는 것입니다 (PMID 12377421). 결과가 흔한 코호트에서 오즈비만 보고되어 있으면, 그 값이 효과를 실제보다 크게 보이게 할 수 있다는 뜻입니다.
이항 회귀에는 약점이 하나 있습니다. 계산이 답에 다다르지 못하는, 곧 수렴하지 않는 경우가 있습니다. 코호트나 무작위 시험처럼 앞으로 따라가며 관찰하는 연구(전향적 연구)에서 위험비를 구하는 법을 정리한 논문은 먼저 위험비가 오즈비보다 선호되어야 한다는 데 문헌의 상당 부분에서 긴 논쟁 끝에 합의가 이루어졌다고 적습니다. 실무 권고는 표준오차를 수정한 로그-푸아송 회귀로, 이항 회귀가 수렴하지 않을 때 대신 쓰는 위험비 계산법 가운데 하나입니다. 오즈비를 잘못 읽을 위험은 결과가 흔할 때 특히 따져야 한다는 단서도 붙습니다 (PMID 26443254).
무작위 시험에는 오즈비 문제가 하나 더 남습니다. 두 군이 완벽하게 균형 잡혀 있어도 생기는 문제이고, 뒤의 「층마다 4인데 전체는 3.4다」 절에서 다룹니다.
한 시점에 세는 설계 — 단면연구
단면연구는 어느 한 시점에 조사해 "지금 이 병이 있는가"를 세는 설계입니다. 오늘 학교에서 학생 2,000명에게 천식이 있는지 묻는 것이 단면연구입니다. 이 설계로 볼 수 있는 것은 조사한 순간 그 병을 가진 사람의 비율, 곧 유병률뿐입니다. 병이 새로 생기는 것은 볼 수 없습니다. 그래서 두 집단을 견줄 지표의 후보가 둘입니다. 하나는 두 집단의 유병률을 나눈 유병비입니다. 다른 하나는 유병오즈비입니다. 유병오즈비는 지금 병이 있는 사람 수를 없는 사람 수로 나눈 값을 두 집단끼리 나눈 것입니다. 유병률이 낮으면 두 값은 거의 같고, 유병률이 높아질수록 벌어집니다.
독일 뮌스터의 대규모 단면조사에서 이 차이가 실제로 나타났습니다. 유병률 7.8%인 천식에서는 모든 추정치가 비슷했습니다. 유병률 17.5%인 천명(숨 쉴 때 쌕쌕거리는 소리)에서는 유병오즈비가 가장 큰 값과 가장 넓은 신뢰구간을 냈습니다. 신뢰구간은 참값이 있을 법한 범위로, 넓을수록 값이 덜 정확하다는 뜻입니다. 저자들은 단면연구가 흔한 병을 다루는 일이 많다는 점을 들어, 유병비를 직접 내주는 모형으로 분석하라고 권고합니다. 계산이 실패하면 계산을 시작하는 값(출발값)을 조정하거나, 또 다른 계산법인 견고 분산 푸아송 회귀를 쓰라는 것입니다 (PMID 15702210).
단면 자료의 지표 논쟁은 끝나지 않았다
유병비를 쓰자는 이 권고에는 반대 의견이 있고, 논쟁은 아직 한쪽으로 정리되지 않았습니다.
단면 자료로 원인을 따지는 문제를 다룬 논문은 유병비 선호론에 정면으로 반대합니다. 누적발생비는 정해진 기간 안에 병이 생긴 사람의 비율을 두 집단끼리 나눈 값입니다. 발생밀도비는 같은 시간 동안 병이 새로 생기는 속도를 두 집단끼리 나눈 값입니다. 이 논문에 따르면, 원인을 따지는 데 필요한 조건들이 갖춰졌을 때 누적발생비는 유병비로도 유병오즈비로도 대개 추정할 수 없고, 유병오즈비는 발생밀도비의 알맞은 추정치를 일관되게 줍니다. 결론은 두 겹입니다. 그 조건들이 성립하지 않으면 여러 요인을 한꺼번에 넣는 다변량 회귀를 아예 피해야 합니다. 조건이 성립한다면 가장 알맞은 것은 로지스틱 회귀입니다 (PMID 20633293).
정반대 결론도 있습니다. 만성질환을 가진 집단의 변화를 미분방정식으로 모형화해, 유병오즈비와 유병비와 병이 새로 생기는 속도의 비 사이의 관계를 따진 논문입니다. 이 논문이 보기에 유병오즈비는 제약적인 가정 없이는 해석하기 어렵습니다. 또 유병오즈비와 유병비는 교란(바깥의 다른 요인 때문에 연관이 부풀거나 줄어드는 것)이나 효과수정(어떤 요인에 따라 효과의 크기가 달라지는 것)을 판단할 때 서로 다른 결론으로 이끌 수 있습니다. 결론은 유병비가 보수적·일관적·해석 가능하므로 선호되어야 한다는 것입니다 (PMID 9624282).
같은 물음에 답이 정반대로 갈립니다. 그러니 독자가 확인할 것은 하나입니다. 단면 자료에서 오즈비를 낸 논문에 그 선택의 이유가 붙어 있는가.
거꾸로 세는 설계 — 환자-대조군 연구
이제 이 글을 연 핀란드 연구의 설계, 환자-대조군 연구로 돌아옵니다. 이 설계에서는 각 군의 위험을 계산할 수 없습니다. 사례(병이 생긴 사람)와 대조(병이 생기지 않은 사람)를 몇 명씩 넣을지 연구자가 정했기 때문입니다. 대조를 두 배로 늘리면 연구 안의 '환자 비율'도 따라 바뀝니다. 그러니 그 비율은 실제 인구의 위험이 아닙니다. 이 설계에서 직접 계산되는 비는 오즈비 하나뿐입니다. 그 오즈비가 무엇을 추정하는지는 대조군을 어떻게 뽑았느냐가 따로 정합니다.
이 사정을 정리한 고전적 논문은 첫 문장에서, 오즈비라는 말이 "기술적으로 옳지만 자주 오해를 부른다"고 적습니다. 대조를 뽑는 방식은 셋이고, 방식마다 오즈비가 추정하는 값이 다릅니다. 대조를 위험에 노출된 시간(사람마다 병이 생길 수 있는 상태로 지낸 시간을 모두 합친 것)에서 뽑으면, 그 오즈비는 비율비, 곧 같은 시간 동안 사건이 일어나는 속도의 비를 추정합니다. 추적을 시작한 시점의 위험 인구에서 뽑으면 위험비를 추정합니다. 추적이 끝난 시점의 생존자에서 뽑으면 오즈비를 추정합니다. 이 세 가지 뽑는 방식 어느 것도 병이 드물다는 가정에 기대지 않습니다. 그래서 저자는 대조군을 어떻게 골랐는지와 그 '오즈비'가 무엇을 추정하는지를 함께 밝히라고 권고합니다 (PMID 8144304).

'드문 병이면 괜찮다'는 규칙이 실제로 쓰이는 자리
희귀 사건 가정은 "병이 드물면 오즈비가 위험비에 가깝다"는 규칙입니다. 흔히 이렇게 배웁니다. 병이 드물면 걸리지 않은 사람이 거의 전부라서, 오즈의 분모(걸리지 않은 사람 수)가 전체 인원과 거의 같아지기 때문입니다. 100명 중 2명이 걸리는 병이라면 오즈는 2 나누기 98이고 위험은 2 나누기 100이라, 사실상 같은 값입니다. 규칙 자체는 맞습니다. 다만 이 규칙이 필요한 자리는 흔히 생각하는 자리와 다릅니다.
희귀성 가정은 오즈비를 위험비로 읽으려 할 때 필요하고, 비율비로 읽을 때는 필요하지 않습니다. 이 자리를 못 박은 것이 1982년 논문입니다. 사례가 병에 걸린 시점마다, 그때 아직 병이 없던 위험군에서 대조를 짝지어 뽑는다고 하겠습니다. 이렇게 짝지어 얻은 오즈비는 표본을 키울수록 참값(발생밀도비)으로 모입니다. 여기에는 병이 드물다는 가정이 필요하지 않습니다. 짝짓지 않고 계산한 오즈비는 연구 기간 내내 노출된 사람의 비율이 일정하지 않으면 한쪽으로 치우칩니다(편향됩니다). 다만 저자는 그 비율이 크게 흔들리지 않는 한 치우침은 무시할 만하다고 덧붙입니다. 초록의 마지막 문장은 연구가 끝난 시점에 대조를 뽑는 종료 시점 표집을 다룹니다. 이때는 병이 드물더라도 노출된 비율이 일정하지 않으면, 그 오즈비는 관심 있는 어떤 값도 제대로 추정하지 못합니다 (PMID 7124721). '드문 병'이라는 사실만으로는 종료 시점 표집의 오즈비가 무언가를 제대로 추정한다는 보장이 되지 않는다는 뜻입니다.
실제 논문들이 기대는 가정
주요 일반의학·역학·임상 전문지에 2001년부터 2007년까지 실린 환자-대조군 연구 150편을 조사한 결과는 이렇습니다.

- 125편(83%)이 새로 생긴 사례를 모았습니다. 사례가 나온 바탕 인구를 근원 인구라고 하는데, 그중 102편(82%)은 사람이 드나드는 동적 인구였고 23편(18%)은 처음 정한 사람들만 따라가는 고정 코호트였습니다.
- 그 125편 중 105편(84%)은 오즈비를 비율비로 해석할 수 있었습니다. 그중 57편(46%)은 그러려면 근원 인구가 안정적이어야 했습니다. 안정적이라는 말은 연구 기간 내내 노출된 사람의 비율이 크게 흔들리지 않았다는 뜻입니다. 나머지 48편(38%)은 사례가 생긴 시점에 맞춰 대조를 뽑은 덕분에 아무 가정도 필요 없었습니다.
- 오즈비를 위험비로 해석할 수 있었던 것은 17편(14%)뿐이고, 그중 16편은 희귀성 가정이 필요했습니다.
- 희귀성 가정을 언급한 논문은 4편인데, 그 논문들 어디에도 그 가정은 실제로 관련이 없었습니다. 안정인구 가정을 언급한 연구자는 한 명도 없었습니다.
괄호 속 퍼센트는 첫 줄만 전체 조사 편수가 분모이고, 나머지는 새 사례를 모은 연구 수가 분모입니다.
저자들의 결론은 이렇습니다. 오즈비를 해석하는 데 필요한 것은 희귀성 가정보다 안정적인 노출 분포인 경우가 훨씬 많습니다. 그리고 연구자들은 자기 오즈비가 무엇을 추정하는지를 거의 논의하지 않습니다 (PMID 18794220). "드문 병이면 괜찮다"는 규칙은 실제 논문들이 기대고 있는 가정과 대체로 다른 것이었습니다.
발병 시점에 맞춰 대조를 뽑는 것만으로 조건이 다 채워지지도 않습니다. 2023년에 다시 정리된 조건은 이렇습니다. 위험도비(hazard ratio, 순간 비율비)는 어느 순간에 사건이 일어나는 속도를 두 집단끼리 나눈 값입니다. 대조를 뽑는 시점을 따로 통제하지 않았다면 두 가지가 함께 있어야 충분합니다. 노출된 사람의 비율이 시간이 지나도 변하지 않는 것, 그리고 위험도비가 시간이 지나도 변하지 않는 것입니다. 뽑는 시점을 통제했다면 위험도비가 변하지 않는 것만으로 충분합니다. 저자들의 권고는 자기 추정치를 그렇게 해석하려고 쓴 모든 조건을 비판적으로 평가하라는 것입니다 (PMID 37712381).
층마다 4인데 전체는 3.4다
오즈비에는 설계와 상관없이 따라다니는 성질이 하나 더 있습니다. 이름보다 숫자를 먼저 보겠습니다. 무작위 시험을 하나 상상해 보겠습니다. 참가자 400명은 병이 잘 생기지 않는 사람들과 잘 생기는 사람들, 두 층으로 나뉩니다. 무작위 배정이 완벽해서 두 층이 치료군과 대조군에 정확히 반반씩 들어갔다고 하겠습니다. 아래는 설명을 위해 지어낸 숫자이고, 오즈비는 각 줄의 숫자로 우리가 직접 계산한 것입니다.
| 층 | 치료군 사건 | 대조군 사건 | 그 층의 오즈비 |
|---|---|---|---|
| 잘 안 생기는 사람들 (각 군 100명) | 50명 | 20명 | 4.0 |
| 잘 생기는 사람들 (각 군 100명) | 80명 | 50명 | 4.0 |
| 둘을 합치면 (각 군 200명) | 130명 | 70명 | 약 3.4 |
첫 줄에서 치료군의 오즈는 50 대 50이니 1, 대조군은 20 대 80이니 0.25이고, 나누면 4입니다. 둘째 줄은 4 나누기 1이라 역시 4입니다. 두 줄을 합치면 치료군은 130 대 70, 대조군은 70 대 130이 되고, 오즈비는 3.4로 내려옵니다.
어느 층에서도 4였는데 전체는 4가 아닙니다. 3.4는 두 층 모두보다 낮아서, 두 층 사이 어딘가에 놓이지도 않습니다. 층별 값의 평균이라고 부를 자리가 없습니다. 같은 표에서 위험비는 다르게 움직입니다. 첫 줄은 50%와 20%이니 2.5배입니다. 둘째 줄은 80%와 50%이니 1.6배입니다. 합치면 65%와 35%이니 약 1.9배이고, 1.9는 2.5와 1.6 사이에 있습니다.

비붕괴성은 집단 전체에서 잰 값이 그 집단을 이루는 개인이나 부분집단들에서 잰 값의 단순 평균이 되지 않는 성질입니다. 표의 오즈비가 바로 이 성질을 보입니다. 반대로 전체 값이 부분 값들의 평균으로 나오는 지표는 붕괴 가능하다고 합니다.
이 성질은 오즈에서 시작합니다. 오즈 자체가 비붕괴적이고, 오즈비는 오즈의 비붕괴성을 더 키웁니다. 비붕괴성은 교란과 다릅니다. 둘은 자주 혼동되어서, 오즈의 이 성질을 다룬 논문의 후속편은 수치 예로 그 차이를 따로 보입니다 (PMID 34119647).
교란은 제3의 요인 때문에 연관이 부풀거나 줄어드는 것입니다. 비붕괴성은 그런 요인이 하나도 없어도 산수만으로 일어납니다. 앞의 표가 그 예입니다. 무작위 배정으로 두 층이 양쪽 군에 반반씩 들어갔는데도, 층을 합치자 오즈비가 내려갔습니다.
실무에서 생기는 착각 — 교란 판정
이 성질 때문에 생기는 흔한 착각이 교란 판정에 있습니다. 어떤 변수를 계산에 넣어 그 영향을 덜어 내는 것을 보정이라고 합니다. 보정 전과 후의 추정치를 비교해 10% 넘게 달라지면 교란이 있다고 보는 관행이 널리 쓰입니다. 그런데 로지스틱 회귀에 이 기준을 적용하면 틀린 결론에 이를 수 있습니다. 앞의 표에서 봤듯, 오즈비는 교란이 없어도 층을 넣고 빼는 것만으로 움직이기 때문입니다.
모의실험으로 따져 보면, 보정 전후 두 추정치의 차이는 실제 교란 편향을 과소평가할 수도 있고 과대평가할 수도 있습니다. 보정 전후로 오즈비가 달라졌다는 사실만으로는 교란이 얼마나 있었는지 판단할 수 없다는 뜻입니다. 처방은 둘입니다. 첫째, 보정할 변수는 설계 단계에서 주제 지식으로 정합니다. 둘째, 교란 편향의 크기를 재려면 보정하지 않은 추정치를 역확률가중 모형의 추정치와 비교합니다. 역확률가중은 노출될 확률의 역수로 가중치를 주어 두 군을 같은 조건으로 맞추는 방법입니다 (PMID 34225653).
균형 잡힌 무작위 시험에서도 남는 차이
조건부 효과는 층 같은 조건을 고정하고 본 효과로, 임상가가 알고 싶은 눈앞의 환자 한 사람에게 적용되는 효과입니다. 주변 효과는 인구 전체를 평균한 효과입니다. 표에서는 층마다 따로 계산한 값이 조건부 오즈비이고, 두 층을 합쳐 계산한 값이 주변 오즈비입니다. 오즈비를 쓰면 기저 조건이 완벽히 균형 잡힌 무작위 시험에서조차 이 둘이 달라집니다.
두 오즈비가 얼마나 다른지는 두 가지에 달려 있습니다. 층을 나눈 변수가 결과와 얼마나 강하게 연관되는지, 그리고 그 변수가 시험 참가자들 사이에 어떻게 분포하는지입니다. 위험비는 비붕괴성의 영향을 받지 않으므로, 균형 잡힌 변수를 보정할 때 조건부 위험비와 주변 위험비는 같습니다. 그래서 이 수치 예를 낸 논문의 권고는 두 갈래입니다. 무작위 시험 보고에서 위험비를 더 자주 쓰자는 것, 그리고 오즈비를 쓸 때는 변수가 균형 잡혀 있더라도 보정을 고려하자는 것입니다 (PMID 21195797).
앞의 표에서 위험비가 층마다 2.5와 1.6으로 달랐던 것은 다른 이야기입니다. 그건 층마다 효과 자체가 달랐던 경우입니다. 위험비가 붕괴 가능하다는 말은, 층마다 위험비가 같다면 합쳐도 그 값이 그대로 유지된다는 뜻입니다. 오즈비는 층마다 같아도 합치면 유지되지 않습니다.
조건부와 주변의 차이는 치료를 고르는 판단까지 바꿀 수 있습니다. 효과수정과 비붕괴성이 함께 있으면, 조건부 추정치로 매긴 치료 순위와 주변 추정치로 매긴 치료 순위가 서로 어긋날 수 있습니다. 두 추정치는 서로 다른 결정 질문에 답하는데, 효과수정이 있으면 그 질문들이 더는 같은 쪽을 가리키지 않기 때문입니다. 권고는 실제로 결정을 내릴 대상 인구에서 두 추정치를 실용적으로 비교하라는 것입니다 (PMID 41626969).
이 글을 연 환자-대조군 연구의 오즈비도 비붕괴적인지는 대조를 어떻게 뽑았느냐에 따라 갈리고, 이 글은 거기까지 다루지 않습니다. 비붕괴성은 마지막 물음으로 이어집니다. 한곳에서 잰 값을 다른 곳으로 옮겨 써도 되는가입니다. 이것이 지금도 진행 중인 오즈비 논쟁의 축입니다.
흔한 오해 둘
① "드문 병이면 환자-대조군의 오즈비는 위험비다"
절반만 맞습니다. 오즈비가 무엇을 추정하는지는 대조를 뽑는 방식이 정하고, 그 추정은 희귀성 가정에 기대지 않습니다. 희귀성이 필요해지는 것은 그 값을 다른 지표, 곧 위험비와 같다고 볼 때입니다 (PMID 8144304, PMID 7124721).
② "그러니 오즈비를 쓰는 논문은 게으른 것이다"
아닙니다. 어떤 설계에서는 오즈비만 직접 계산되고, 어떤 표집 방식에서는 그 오즈비가 비율비를 제대로 추정합니다 (PMID 8144304). 오즈비를 조심하라고 가르치는 쪽도 이 점을 인정합니다. 한 입문 논문은 오즈비가 상대위험의 추정치로 무비판적으로 쓰이지만 않는다면 역학자에게 여전히 매력적인 통계량으로 남는다고 맺습니다 (PMID 10390080). 여기서 상대위험은 위험비와 같은 말입니다.
덧붙여 — 오즈비를 위험비로 바꾸는 식
오즈비를 위험비로 되돌리는 식은 실제로 있습니다. 널리 인용되는 것은 1998년에 나온 보정식입니다. 보정 오즈비와 비노출군의 사건률(노출되지 않은 사람들 가운데 사건을 겪은 비율)을 넣으면 위험비의 근사값이 나옵니다. 저자들이 이 식을 낸 이유는 결과가 흔하면(10% 초과) 보정 오즈비가 더는 위험비에 근사하지 않기 때문입니다. 결과가 흔해질수록 오즈비는 1보다 클 때 위험비를 과대추정하고, 1보다 작을 때 과소추정합니다 (PMID 9832001).
다만 변환에는 대가가 따릅니다. 변환한 값은 신뢰구간이 부정확할 수 있습니다 (PMID 12377421). 또 아래 논쟁에서 오즈비 대체에 반대하는 쪽은, 오즈비 지지 진영이 권하는 변환법이 값 자체부터 편향되어 있다고 비판합니다 (PMID 34390790).
정직한 미해결 — 오즈비를 버려야 하는가
이 물음에는 아직 합의된 답이 없습니다.
오즈비를 지지하는 논거 — 이식가능성
이식가능성은 한곳에서 잰 효과의 값을 사정이 다른 곳에 그대로 옮겨 써도 되는 성질입니다. 어느 시험에서 잰 값이 위험이 훨씬 높은 다른 환자들에게도 그대로 통하면, 그 지표는 이식 가능합니다. 지침을 쓰는 사람은 늘 남의 나라 시험 결과를 자기 환자에게 옮겨 씁니다. 이 논쟁에서 말하는 사정의 차이는 기저위험의 차이입니다. 기저위험은 치료나 노출이 없을 때 그 사람들이 원래 가진 사건 위험입니다.
한쪽 진영의 주장은 이렇습니다. 임상역학에서 위험비 대신 오즈비를 써야 하고, 그 이유가 이식가능성입니다. 오즈비는 기저위험과 무관한 반면 위험비는 그렇지 않다는 것입니다. 이들은 상대편이 든 예제들로 다시 계산해 위험비의 비이식성을 재확인했다고 주장합니다. 두 지표는 다른 것을 재고, 그 수치 차이는 오해했을 때만 문제라고 봅니다. 비붕괴성도 교란 요인이 아닌 위험요인이 있으면 당연히 예상되는 현상이고, 편향은 아니라고 봅니다. 나아가 위험비를 내주는 회귀 모형(log link)과 메타분석에서의 위험비 사용 자체가 문제라는 것도 같은 예제로 보인다고 적습니다. 이 대목은 이 글이 앞에서 옮긴 직접 추정 권고를 정면으로 겨눕니다. 결론은 오즈비가 위험비를 대체하되, 최종 산출물은 위험의 비나 차이로 변환하자는 것입니다 (PMID 34380019).
반대 논거 — 데이터가 그렇게 말하지 않는다
메타분석은 같은 물음을 다룬 여러 연구를 모아 하나의 값으로 합치는 분석이고, 코크런 데이터베이스는 그런 분석을 모아 둔 곳입니다. 첫 반박은 이 데이터베이스의 메타분석 40,243건에서 나왔습니다. 대부분의 메타분석에서 기저위험이 낮은 연구일수록 오즈비가 높은 경향이 나타났습니다. 오즈비가 기저위험과 무관하다는 지지 진영의 핵심 전제와 어긋나는 결과입니다. 결론은 대체가 현재로서는 권할 만하지 않다는 것, 그리고 어떤 지표도 이식 가능하지 않을 가능성이 있다는 것입니다 (PMID 34384876).
두 번째 반박은 같은 데이터베이스의 메타분석 20,198건을 다시 조사한 뒤, 상대편 논거의 오류를 넷으로 정리합니다. 첫째는 순환논증입니다. 오즈비가 일정하다고 가정한 모형을 세워 놓고, 그 모형 아래에서 오즈비가 이식 가능하다고 보였다는 것입니다. 둘째, 그들이 권하는 변환법은 편향되어 있습니다. 셋째, 위험비는 이식 가능하고 오즈비는 이식 가능하지 않은 메타분석 반례가 있습니다. 넷째, 어떤 연구가 메타분석에 들어가는지를 정하는 원인들을 고려하지 않았습니다.
다만 이 논문이 직접 잰 결과는 어느 한쪽 편도 들지 않습니다. 오즈비와 위험비의 이식가능성은 상황에 따라 달랐습니다. 그래서 결론이 두 겹입니다. 저자들은 위험비를 오즈비로 대체하자는 제안이 순환논증에 기대고 있으며 메타분석과 임상 지침에는 특히 오해를 부른다고 못 박습니다. 그러면서도 오즈비도 위험비도 보편적으로 이식 가능하지 않다고 적습니다. 대안은 기저위험처럼 효과의 크기를 바꾸는 요인(수정 요인)에 따라 효과가 어떻게 달라지는지를 보고하는 것입니다. 그 변동을 이해하는 것이 환자 중심 진료에 본질적이라는 것이 마지막 문장입니다 (PMID 34390790).
지표를 바꾸면 무엇이 바뀌고 무엇은 안 바뀌나 — 그리고 화해안
지표를 바꿔도 결론은 거의 그대로이고, 달라지는 것은 연구들 사이의 어긋남과 치우침 검정 결과입니다. 메타분석 235건(리뷰 147건)을 오즈비·위험비·위험차 세 지표로 다시 분석한 결과입니다. 위험차는 두 집단의 위험을 뺀 값입니다. 연구들 사이의 어긋남을 재는 값은 오즈비에서 가장 낮았습니다(중앙값 42%). 위험비에서는 5.1%포인트, 위험차에서는 15.0%포인트 더 높았습니다. 작은 연구들의 치우침을 보는 검정은 위험비에서 가장 자주 유의했습니다(32%). 위험차는 29%, 오즈비는 24%였습니다. 그리고 효과가 통계적으로 유의한가라는 결론은 거의 바뀌지 않았습니다. (PMID 25666885).
이 논쟁을 정리하는 오래된 제안도 있습니다. 세 지표를 비교한 논문은 먼저 세 가지를 짚습니다. 자료가 있는 범위 밖으로 값을 크게 늘려 짐작하는 극단적인 외삽이 없는 한, 세 모형은 대개 작은 수치 차이만 냅니다. 위험차·상대위험 모형은 음수이거나 전체보다 큰, 불가능한 사건률을 예측할 수 있습니다. 그리고 각 지표에는 이론적 정당성이 있습니다. 그 뒤에 내놓은 제안은 이렇습니다. 위험차와 상대위험은 위험을 소통하는 데 이점이 있을 수 있고, 오즈비는 데이터 분석에 선호될 수 있습니다. 두 목적을 분명히 구분해야 하며, 각각에 다른 지표가 필요할 수 있습니다 (PMID 11004419).
더 깊이 가려면
논문에서 오즈비를 만났을 때 물어볼 것은 세 가지입니다.
- 어떤 설계인가. 환자-대조군 연구라면 각 군의 위험을 셀 수 없어서, 직접 계산되는 것이 오즈비입니다. 코호트나 무작위 시험이라면 위험비를 직접 추정할 수 있었는데 안 한 것일 수 있습니다 (PMID 12377421).
- 오즈비가 무엇을 추정하는가. 환자-대조군 연구라면 대조를 어디서 뽑았는지가 그것을 정합니다 (PMID 8144304). 단면 자료라면 오즈비를 고른 이유가 붙어 있는지 봅니다 (PMID 20633293).
- 보정 전후로 값이 달라졌다면, 그게 교란인가. (PMID 34225653). 지표 논쟁을 다른 틀로 다시 짜려는 시도들도 있으나 이 글은 거기까지 가지 않습니다.
오즈비는 틀린 숫자가 아닙니다. 다른 것을 재는 숫자입니다. 그리고 그 숫자를 고른 것은 대개 저자의 성의가 아니라 설계입니다. 층마다 4인데 전체가 3.4인 표 하나를 기억해 두면 충분합니다. 그 한 장이 "보정했더니 값이 달라졌다"는 문장을 읽는 방식을 바꾸고, 논쟁이 왜 안 끝났는지도 설명합니다. 다음에 초록에서 오즈비를 만나면, 값보다 설계를 먼저 보게 될 것입니다.
근거 논문
설계와 지표
- "…directly estimate risk ratios in cohort studies of common outcomes." (2002) — PMID 12377421 — 결과가 흔한 코호트에서 오즈비는 위험비를 심하게 과대추정할 수 있습니다. 변환법은 신뢰구간이 부정확할 수 있어 이항 회귀 직접 추정을 권고.
- "…Adjusted Risk Ratio in Prospective Studies." (2015) — PMID 26443254 — 위험비 선호는 문헌의 상당 부분에서 논쟁 끝에 합의됐고 log-binomial은 수렴 실패가 있을 수 있습니다. 권고는 표준오차 수정 로그-푸아송.
- "…effect estimates in cross-sectional studies." (2004) — PMID 15702210 — 뮌스터 단면조사. 천식(7.8%)은 추정치가 비슷, 천명(17.5%)은 유병오즈비가 최대값·최대폭. 흔한 병을 다루는 일이 많으므로 log-binomial, 실패 시 출발값 조정이나 견고 분산 푸아송.
- "…appropriateness of the prevalence odds ratio…" (2010) — PMID 20633293 — 유병오즈비 옹호. 누적발생비는 어느 쪽으로도 추정 불가, 유병오즈비가 발생밀도비를 일관되게 줍니다. 가정이 안 서면 회귀 회피, 서면 로지스틱.
- "Prevalence odds ratio or prevalence ratio…" (1998) — PMID 9624282 — 반대 결론. 유병오즈비는 제약적 가정 없이 해석이 어렵고 교란·효과수정에서 다른 결론을 낼 수 있습니다. 유병비가 보수적·일관적이라 선호되며, 다변량 추정은 일반화선형모형이나 비례위험 회귀로.
환자-대조군과 희귀성
- "What does the odds ratio estimate in a case-control study?" (1993) — PMID 8144304 — 첫 문장이 "기술적으로 옳지만 자주 오해를 부른다". 대조 표집(인시 / 시작 시점 위험 인구 / 종료 시점 생존자)에 따라 비율비·위험비·오즈비를 추정하며 어느 것도 희귀성 가정에 의존하지 않습니다.
- "On the need for the rare disease assumption…" (1982) — PMID 7124721 — 발생밀도 표집의 매칭 추정량은 일치추정량이고 희귀성 가정은 필요 없습니다. 비매칭 추정량은 노출 비율이 일정하지 않으면 편향되나 변동이 크지 않는 한 무시할 만합니다. 마지막 문장: 병이 드물어도 노출 비율이 일정하지 않으면 누적 표집 오즈비는 어떤 값도 일치추정 못 합니다.
- "What do case-control studies estimate?…" (2008) — PMID 18794220 — 150편 조사(2001~2007년). 발생 사례 125편(83%; 동적 102·고정 23) 중 105편(84%)이 비율비 해석 가능(57편 안정인구 필요, 48편 불필요), 위험비 해석은 17편(14%). 희귀성을 언급한 4편엔 그 가정이 무관했고 안정인구 가정은 아무도 언급 안 했습니다.
- "…odds ratios as rate-ratio estimates…" (2023) — PMID 37712381 — 발병 시점 위험군 표집만으로는 부족. 시점 미통제 시 노출 유병률의 불변성 + 위험도비(hazard ratio)의 시간 불변성이면 충분, 통제 시 위험도비의 불변성만으로 충분.
- "…Limitations of the Odds Ratio…" (2021) — PMID 34813689 — 논평. 원 연구는 5년 초과 프로락틴 상승 약물에서 유방암 오즈가 유의하게 높았고 비상승 약물에선 유의하지 않았다고 보고. 결론은 이 설계·결과로 두 약물군을 비교 판단할 수 없다는 것, 프로락틴 상승의 부작용 관리는 바람직하다는 것.
비붕괴성
- "Noncollapsibility… Part 2…" (2021) — PMID 34119647 — 오즈비가 오즈의 비붕괴성을 증폭하며 비붕괴성은 교란과 다르다(자주 혼동됨). 1편이 오즈의 비붕괴성을 수치 예로 보였습니다.
- "Noncollapsibility and its role…" (2021) — PMID 34225653 — 10% 변화 기준을 로지스틱 계수에 쓰면 틀릴 수 있습니다. 다변량 회귀와 역확률가중은 서로 다르지만 둘 다 타당한 추정치를 냈습니다. 권고는 보정 변수를 설계 단계에서.
- "…a plea for multivariable risk ratios." (2011) — PMID 21195797 — 균형 잡힌 무작위 시험에서도 조건부·주변 오즈비가 다를 수 있고, 차이는 층화변수와 결과의 연관 강도·분포에 달렸습니다.
- "Effect modification and non-collapsibility together…" (2025) — PMID 41626969 — 종설. 둘이 함께 있으면 조건부·주변 추정치 사이에 상충하는 치료 순위가 나올 수 있습니다. 권고는 대상 인구에서 둘을 비교하는 것, 둘 다 낼 수 있는 방법은 다수준 네트워크 메타회귀뿐.
변환과 논쟁
- "…correcting the odds ratio in cohort studies…" (1998) — PMID 9832001 — 보정식. 결과가 흔하면(>10%) 보정 오즈비는 위험비에 근사하지 못하고 1보다 클 때 과대·작을 때 과소추정.
- "The Odds Ratio is 'portable' across baseline risk…" (2022) — PMID 34380019 — 오즈비 지지. 이식가능성을 근거로 오즈비가 위험비를 대체해야 한다는 주장이며, 비붕괴성은 편향이 아니라 예상되는 것으로 봅니다. log link 회귀와 메타분석의 위험비 사용도 문제라고 적습니다.
- "…Paper 2: Is the Odds Ratio 'portable'…?" (2022) — PMID 34384876 — 반박 1. 코크런 메타분석 40,243건에서 기저위험이 낮은 연구일수록 오즈비가 높은 경향. 대체는 권할 만하지 않고 어떤 지표도 이식 가능하지 않을 가능성. 제안은 기저위험에 따른 조건부 효과의 병기.
- "…Paper 4: Odds Ratios are far from 'portable'…" (2022) — PMID 34390790 — 반박 2. 메타분석 20,198건 재조사, 오류 넷(순환논증·변환법 편향·반례·포함 기준). 실증은 이식가능성이 상황에 따라 달랐다는 것. 결론은 대체 제안이 메타분석과 임상 지침에 특히 오해를 부른다는 것, 어느 쪽도 보편적으로 이식 가능하지 않으니 효과 변동을 보고하라는 것.
- "Choice of effect measure for meta-analyses…" (2015) — PMID 25666885 — 메타분석 235건(리뷰 147건) 재분석. 연구 간 어긋남은 오즈비 최저(중앙값 42%), 위험비 +5.1%p·위험차 +15.0%p. 위험비로 바꿔도 관측 효과가 바뀐 건 3%. 유의성 결론은 거의 바뀌지 않았습니다.
- "Choice of effect measure for epidemiological data." (2000) — PMID 11004419 — 세 지표 비교. 극단적 외삽이 없으면 대개 작은 수치 차이만 나고, 위험차·상대위험 모형은 불가능한 사건률을 낼 수 있습니다. 제안은 분석용·소통용의 구분.
- "…odds ratio as an approximation to the relative risk." (1999) — PMID 10390080 — 입문. 오즈비가 무비판적으로 상대위험 추정치로 쓰이지만 않는다면 역학자에게 여전히 매력적인 통계량입니다.