
Paperis 아티클
사전확률은 어디서 오는가 — 병력과 진찰, 그리고 임상 예측규칙
같은 증상도 어느 진료 환경에서 보느냐에 따라 다른 확률입니다 — 검사 앞에서 이미 정해지는 출발점
사전확률은 어디서 오는가 — 병력과 진찰, 그리고 임상 예측규칙
「검사는 무엇을 말해 주나 — 민감도·특이도와 사전확률 입문」은 결과지의 숫자 하나가 왜 그것만으로는 답이 되지 못하는지에서 끝났습니다. 검사가 정하는 것은 확률을 얼마나 옮기느냐이고, 어디에서 출발하느냐는 그 사람이 정하기 때문입니다. 사전확률은 검사하기 전에 이 사람이 그 병일 확률입니다. 이 출발점은 검사지 어디에도 적혀 있지 않습니다.
그러면 사전확률은 어디에 적혀 있을까요.
답은 시시할 만큼 오래된 것입니다. 사전확률은 문진과 진찰, 그리고 그 사람이 여기까지 온 경로에서 나옵니다. 검사실 문 앞에 왔을 때 판단의 절반은 이미 끝나 있습니다. 다만 이 절반은 사람이 채우는 자리라서, 사람이 하는 일의 성질을 그대로 물려받습니다. 사람마다 흔들리고, 한쪽으로 치우칩니다. 그래서 도구가 필요해집니다.
이 글은 앞 글의 말 몇 개를 그대로 씁니다. 민감도는 실제 그 병인 사람을 검사가 양성으로 걸러 낸 비율이고, 특이도는 그 병이 아닌 사람을 음성으로 걸러 낸 비율입니다. 둘 다 검사에 딸린 성질입니다.
우도비는 어떤 결과가 병 있는 사람에게서 나올 가능성이 병 없는 사람에게서 나올 가능성의 몇 배인가를 나타낸 값입니다. 두 가능성이 같으면 우도비는 1이고, 확률을 전혀 옮기지 못합니다. 1보다 크면 병 쪽으로, 작으면 반대쪽으로 확률을 밉니다. 사후확률은 검사 결과를 반영한 뒤의 확률, 곧 검사 후 확률입니다. 사전확률과 우도비가 함께 사후확률을 만듭니다.
왜 알아야 하나 — 출발점을 정하는 손이 흔들린다
같은 환자 이야기를 받아도 임상가마다 매기는 사전확률은 크게 다릅니다. 호주와 영국의 내과 전문의·일반의 819명에게 같은 시나리오 세 개(허혈성 심질환, 심부정맥혈전증, 뇌졸중)를 우편 설문으로 보내 검사 전 확률을 적게 한 조사가 그것을 보여 줍니다. 비교 기준이 된 「정답」은 검증된 임상 예측규칙으로 계산한 값이었습니다. 임상 예측규칙은 병력·진찰·기본 검사 소견을 묶어 환자의 확률을 매기는 도구입니다.
정답의 20%포인트 이내에 들어온 사람은 심질환·뇌졸중 시나리오에서 약 55%였고, 심부정맥혈전증 시나리오에서는 6.7%였습니다. 인구학적 특성, 진료 형태, 교육 이력 가운데 정확도를 뚜렷이 예측하는 것은 없었습니다. 사전확률 추정은 경험 많은 임상가 사이에서도 넓게 흩어집니다. 저자들은 결론에서 임상가를 탓하지 않고 도구를 말했습니다. 임상 예측규칙을 개발하고 보급해 실무 판단을 받쳐 줘야 한다는 것입니다 (PMID 15115422).
사전확률은 흩어지기만 하지 않고 한쪽으로 치우치기도 합니다. 흉통과 호흡곤란으로 왔지만 심전도로 진단이 나오지 않고 뚜렷한 진단도 없는 환자 840명의 다기관 자료가 그 예입니다. 임상의가 눈대중(gestalt)으로 매긴 검사 전 확률은 검증된 전산 방식보다 일관되게 높았습니다. 급성 관상동맥증후군에서 17% 대 4%, 폐색전증에서 12% 대 6%였습니다 (PMID 24070658).
두 방식이 환자를 얼마나 잘 갈라 놓았는지는 곡선 아래 면적으로 비교했습니다. 곡선 아래 면적은 병이 있는 사람과 없는 사람을 얼마나 잘 갈라 놓는지를 하나의 숫자로 요약한 값으로, 클수록 잘 가릅니다. 이 값은 폐색전증에서 두 방식이 비슷했고(0.81 대 0.84), 관상동맥증후군에서는 눈대중 쪽이 낮았습니다(0.64 대 0.78) (PMID 24070658). 눈대중은 확률을 높게 잡으면서도, 폐색전증에서는 환자를 가르는 힘이 전산 방식만큼 정확했다는 뜻입니다.
같은 모습이 예후 추정에서도 나옵니다. 만성 콩팥병 환자 257명과 담당 신장내과 의사를 함께 추적했더니, 2년 안에 말기 신부전에 이른 사람은 13%였습니다. 환자, 의사, 위험 계산식이 낸 세 가지 추정은 모두 누가 더 위험한지 순위를 매기는 능력이 좋았습니다(c 통계량 0.8 초과). c 통계량은 이런 예측에서 곡선 아래 면적과 같은 뜻으로 쓰는 값입니다. 그러나 실제 결과와 견주면 의사와 환자 모두 위험을 과대추정했고, 실제 발생률에 가장 잘 맞은 것은 계산식이었습니다 (PMID 30630859).
이 연구들이 보여 주는 것은 사전확률 추정이 원래 어려운 일이라는 사실입니다. 의사를 못 믿겠다는 이야기와는 방향이 반대입니다. 사전확률 추정이 어렵다는 사실이 인정됐기 때문에, 병력과 진찰의 무게를 재는 연구가 생겼고 그것을 묶은 예측규칙이 만들어졌습니다. 이 글의 나머지는 그 도구들을 따라갑니다.
큰 그림 — 사전확률의 재료는 셋이다
사전확률에는 재료가 셋 있습니다. 첫째 재료는 유병률입니다. 유병률은 어떤 집단에서 그 병을 가진 사람의 비율입니다. 집단 전체를 놓고 보면 유병률이 곧 사전확률입니다.
| 재료 | 무엇인가 | 어디서 오나 |
|---|---|---|
| ① 그 사람이 속한 집단의 유병률 | 이 환경에서 이 증상으로 온 사람들 중 몇 명이 그 병인가 | 진료 환경, 의뢰 경로, 역학 자료 |
| ② 병력과 진찰이 옮긴 확률 | 문진·신체검사 소견 하나하나가 확률을 미는 힘 | 우도비, 예측규칙 |
| ③ 이미 나온 다른 검사 결과 | 앞선 검사의 사후확률 | 한 검사의 사후확률이 다음 검사의 사전확률이 되는 연쇄 |
이 셋을 합친 값이 다음 검사의 출발점이 됩니다. 사전확률을 어떻게 추정하느냐에 따라 추가 검사를 할지 말지, 어떤 검사를 할지, 결과를 어떻게 읽을지, 그 뒤에 무엇을 할지가 모두 달라집니다 (PMID 34740785).
세 재료 가운데 첫째인 유병률이 가장 자주 잊히고, 가장 크게 움직입니다.
측두동맥염이 그 대비를 그대로 보여 줍니다. 이 병의 일반 인구 유병률은 1% 미만입니다. 그런데 측두동맥 생검을 받으러 의뢰된 환자만 보면 39%가 생검 양성이었습니다(핵심 연구 21편의 종합) (PMID 11754714). 같은 병, 같은 검사인데 출발점이 40배 가까이 다릅니다. 두 숫자 사이에 있는 것은 의뢰라는 필터, 곧 누군가가 이미 한 번 걸러서 보냈다는 사실입니다.
이 필터는 어디에나 있습니다. 아래 값은 모두 그 연구가 그 환경에서 관측한 값입니다.
- 일반의가 폐렴을 의심해 항생제를 쓰며 의뢰한 성인 71명 중 흉부 X선으로 확인된 폐렴은 15%였습니다 (PMID 3387706).
- 관절 하나가 갑자기 아파서 응급실에 온 성인에서 비임균성 패혈성 관절염의 유병률은 약 27%로 추정됐습니다 (PMID 21843213).
- 급성 손목 외상으로 응급실에 온 환자 중 실제 골절은 39%였습니다 (PMID 26682537).
- 정형외과·가정의학과 클리닉과 지역사회에서 무릎 문제로 연속 등록된 279명에서는, 같은 사람들인데 진단마다 유병률이 제각각이었습니다. 증상성 반월상연골 파열은 28.7%, 증상성 무릎 골관절염은 46.2%, 슬개대퇴통증은 26.9%였습니다 (PMID 29111463, PMID 29781110, PMID 29128344).
마지막 항목에서 보듯, 같은 환자 집단 안에서도 어떤 진단을 묻느냐에 따라 사전확률이 통째로 달라집니다. 사전확률은 환자에게 붙은 숫자 하나가 아닙니다. 이 환자, 이 환경, 이 질문, 이 셋이 함께 정하는 값입니다.

의뢰라는 필터는 논문에 실린 숫자에도 묻어 있습니다. 어깨 통증의 진찰 소견을 메타분석한 개관에서 포함된 연구는 전부 전문의가 의뢰된 환자를 진찰한 것이었습니다. 질 높은 연구들에서 회전근개 질환의 유병률은 33~81%로 흩어졌습니다. 저자들은 그래서 이 결과가 의뢰되지 않은 집단에도 들어맞는지는 알 수 없다고 스스로 적습니다 (PMID 23982370).
그러면 유병률 숫자는 또 어디서 올까요. 여기에는 아직 메워지지 않은 구멍이 있습니다. Cochrane 진단정확도 리뷰 59편(메타분석 308건) 가운데 사전확률을 실제로 쓴 분석은 148건이었고, 그 값의 출처는 리뷰에 포함된 연구, 외부 자료, 저자 합의로 제각각이었습니다. 같은 질환의 여러 메타분석을 나란히 비교하려고 모두에 같은 사전확률을 씌운 경우, 그 값이 그 질환을 다룬 분석들의 유병률 범위 안에 든 것은 약 절반이었습니다 (PMID 32299367). 저자들은 같은 사전확률을 씌울지, 그 값이 해석을 어떻게 바꾸는지를 리뷰 저자들이 따져 봐야 한다고 제안합니다. 그러니 「이 병의 사전확률은 X%」라는 문장은 대개 어떤 자료에서 어떤 방식으로 고른 대푯값 하나입니다. 사전확률을 점이 아니라 범위로 읽어야 하는 이유가 여기 있습니다.
기본 용어를 쉽게
병력과 진찰 소견도 우도비를 갖습니다. 우도비는 혈액 수치나 영상에만 붙지 않습니다. "턱이 아파서 씹다 멈춘 적이 있는가"라는 질문 하나에도 우도비가 있습니다. 이 글에서 가장 중요한 문장일지도 모릅니다.
소견이 있을 때의 우도비를 양성 우도비, 소견이 없거나 검사가 정상일 때의 우도비를 음성 우도비라고 부릅니다. 양성 우도비는 클수록 병 쪽으로, 음성 우도비는 작을수록 반대쪽으로 확률을 크게 옮깁니다.
병력과 진찰의 힘은 자주 과소평가됩니다. 우도비로 임상 평가와 부가 검사를 나란히 견준 개관은 이렇게 주장합니다. 현대 의료는 정교한 검사와 영상을 강조하면서 병력과 진찰을 보완하기보다 밀어내는 경향이 있습니다. 그런데 실제로 재 보면 임상 평가와 부가 검사의 판별력이 비슷한 경우가 흔하고, 임상 평가가 더 많은 정보를 주는 일도 자주 있습니다 (PMID 9666947).
실제 값을 몇 개 봅니다. 모두 그 연구가 그 환자들에게서 관측한 값이고, 어떤 환자들이었는지가 값만큼 중요합니다.
- 측두동맥 생검에 의뢰된 환자들에서, 병력 가운데 확률을 뚜렷이 올린 것은 턱 파행(양성 우도비 4.2)과 복시(3.4) 둘뿐이었습니다. 턱 파행은 씹다가 턱이 아파 멈추는 증상입니다. 진찰에서는 측두동맥이 염주알처럼 만져지는 변화(4.6), 돌출(4.3), 압통(2.6)이 확률을 올렸습니다. 적혈구침강속도가 정상이면 확률이 크게 내려갔습니다(음성 우도비 0.2). 반대로 측두동맥에 아무 이상이 없다는 소견은 확률을 조금 내리는 데 그쳤습니다(0.53) (PMID 11754714).
- 인플루엔자에서는 오한(7.2), 발열과 발병 3일 이내 내원의 조합(4.0), 발한(3.0)이 확률을 올렸습니다. 전신 증상·기침·일상생활 수행 불가·침상 안정이 없으면 확률이 내려갔습니다(0.36~0.50). 저자들의 결론은 개별 징후·증상의 가치는 제한적이며, 증상을 체계적으로 조합하는 규칙 쪽이 더 유용한 전략일 수 있다는 것이었습니다 (PMID 15014046).
우도비가 양성·음성 둘뿐일 필요도 없습니다. 결과가 수치로 나오면 값의 구간마다 우도비를 매길 수 있습니다. 패혈성 관절염에서 관절액 백혈구 수의 구간별 우도비는 낮은 구간에서 0.33, 중간 구간에서 1.06, 그 위 구간에서 3.59였습니다 (PMID 21843213). 중간 구간의 값은 사실상 아무것도 옮기지 않습니다. 같은 검사가 값에 따라 배제 쪽, 중립, 확진 쪽을 오갑니다.
임상가가 중요하다고 믿는 소견과 실제로 진단을 가르는 소견은 다를 수 있습니다. 이 차이를 정면으로 잰 연구가 있습니다. 근골격계 의사 51명에게 고관절 골관절염과 요추 척추관협착증을 가르는 데 징후·증상 83개가 각각 얼마나 가치 있는지 설문했습니다. 그다음 가장 가치 있다고 꼽힌 증상 32개와 진찰 항목 13개를 실제 환자에게 적용해 양성 우도비를 계산했습니다. 환자는 고관절 골관절염 77명, 척추관협착증 79명이었습니다.
의사들이 꼽은 증상 32개 가운데 실제로 두 진단을 가른 것은 11개였습니다. 고관절 쪽을 지지한 증상은 서혜부 통증(4.9), 걷다 보면 줄어드는 통증(3.9) 등이었습니다. 척추관협착증 쪽을 지지한 증상은 무릎 아래 통증(2.3), 다리 저림·감각이상(2.7)이었습니다. 쇼핑카트를 밀면 통증이 덜하다는 소견의 우도비는 1.0으로, 아무것도 옮기지 않았습니다. 요통(1.1), 다리 무력감(1.1), 둔부 통증(1.2)도 마찬가지였습니다.
진찰은 달랐습니다. 의사들의 기대대로 진찰 항목 13개 중 7개가 고관절 쪽을 강하게 지지했습니다(아픈 다리에 체중을 못 싣는 것 10, 관찰되는 파행 9). 신경학적 결손 네 가지는 척추관협착증 쪽을 지지했습니다 (PMID 30708114).
어떤 소견이 확률을 옮기는지는 믿음으로 정해지지 않고, 재 봐야 알 수 있습니다. 진찰이 문진보다 낫다는 뜻은 아닙니다.
이런 소견을 여러 개 묶은 것이 임상 예측규칙입니다. 앞에서 이 규칙을 소견을 묶어 확률을 매기는 도구라고 했습니다. 임상 결정규칙이라고도 부릅니다. 더 정확히는 병력·진찰·기본 검사가 각각 진단·예후·치료 반응에 기여하는 몫을 수량화해, 환자를 확률에 따라 나누는 도구입니다. 근거중심의학 사용자 안내서는 규칙을 임상가의 직관적 감각을 형식적으로 검증하고, 단순화하고, 정확도를 높이려는 시도라고 설명합니다. 규칙은 세 단계를 거쳐 만들어집니다 (PMID 10872017).
도출(derivation)은 한 집단에서 예측인자를 찾아 규칙을 만드는 단계이고, 검증(validation)은 그 규칙을 다른 집단·다른 환경에서 다시 재 보는 단계입니다. 규칙을 만든 자료 바깥의 병원과 환자에서 하는 검증을 외부 검증이라고 부릅니다.
영향 평가(impact analysis)는 규칙을 실제로 쓰게 했을 때 진료와 결과가 바뀌는지 보는 단계입니다. 세 단계는 각각 다른 질문에 답합니다.
| 단계 | 답하는 질문 |
|---|---|
| 도출 | 이 자료에서 무엇이 확률을 가르나 |
| 검증 | 그 성능이 여기서도 나오나 |
| 영향 평가 | 이 도구가 사람에게 이득을 주나 |
사용자 안내서는 새 환경에서 검증까지 마친 규칙을 1수준(level 1)으로 두고, 이것이 도입에 가장 적합하다고 봅니다 (PMID 10872017). 영향 평가의 방법론을 따로 정리한 논문은 이 지점을 더 강하게 말합니다. 대부분의 연구는 도출 단계에 머물고, 검증까지 가는 것은 소수이며, 영향 평가까지 가는 것은 극소수입니다. 그런데 규칙을 의사결정 과정에 넣는 것이 실제로 환자 진료를 개선하는지 평가하는 가장 효율적인 방법은 영향 평가라는 것입니다 (PMID 21999201).
규칙의 실물을 하나 봅니다. 암스테르담 손목 규칙은 급성 손목 외상으로 응급실에 온 환자 가운데 X선 촬영을 할 사람을 고르는 규칙입니다. 다섯 개 병원의 환자 882명(도출 487명, 외부 검증 395명)에서 나이·부종·압통 등 여덟 변수로 만들어졌습니다. 외부 검증에서 곡선 아래 면적은 0.81이었습니다. 민감도는 98%로 골절을 거의 놓치지 않았지만, 특이도는 21%로 낮았습니다. 음성예측도, 곧 규칙이 음성이라고 한 사람이 실제로 골절이 아닐 확률은 90%였습니다. 저자들은 100% 민감도에 이르지 못했고 특이도가 낮다는 점을 명시하면서, 이 규칙을 선별용 도구로 자리매김합니다 (PMID 26682537).
민감도 98%·특이도 21%라는 조합은 문턱을 어디에 긋느냐에서 나옵니다. 「검사는 무엇을 말해 주나」에서 보았듯, 문턱을 낮추면 더 많이 잡아내는 대신 더 많이 헛짚습니다. 이 규칙은 놓치지 않는 쪽에 값을 몰아준 도구입니다. 무엇을 더 피하고 싶은지가 도구의 모양을 정합니다.
저자들이 자기 규칙에 대해 「아직 아니다」라고 스스로 적는 것이 좋은 규칙 논문의 표식입니다. 뒤에서 볼 검증·영향 평가 단계의 논문들도 자기 한계를 먼저 적습니다.
예측규칙을 평가할 때 흔히 성능 하나만 봅니다. 그런데 성능에는 서로 다른 두 얼굴이 있고, 둘은 서로를 보완합니다 (PMID 34882175).
- 판별력(discrimination)은 병이 있는 사람과 없는 사람의 순서를 잘 매기는 능력입니다. 곡선 아래 면적으로 요약합니다.
- 보정(calibration)은 모형이 내놓은 숫자의 눈금이 실제와 맞는 정도입니다. 모형이 「30%」라고 말한 사람 100명 중 실제로 30명쯤에게 그 일이 일어나면 보정이 좋은 것입니다.
이 둘은 갈라질 수 있고, 아주 크게 갈라지기도 합니다.
중환자 사망 예측 모형 43개를 두 코호트에서 외부 검증한 연구가 대표적입니다. 애초에 재현에 필요한 정보가 있어 검증할 수 있었던 모형은 43개 중 11개(26%)뿐이었습니다. 그중 몇몇은 판별력이 좋았지만(곡선 아래 면적 최대 0.83), 대부분 보정이 나빴습니다. 예측 확률 전체의 높낮이를 정하는 절편과, 예측이 얼마나 극단으로 퍼지는지를 정하는 기울기를 새 자료에 맞게 다시 맞춘 뒤에야, 곧 재보정한 뒤에야 중간 수준이 됐습니다 (PMID 36378565). 논문 제목이 그대로 요약입니다. 판별력은 보존되고, 보정은 나빴습니다.
재활에 더 가까운 예도 있습니다. 뇌졸중 후 실어증의 장기 예후를 예측하는 모형을 다른 시험의 자료 131명에서 외부 검증했습니다. 판별력은 좋았습니다(곡선 아래 면적 0.87). 그러나 6개월 시점에 좋은 결과를 보인 사람은 124명 중 86명(68%)이었는데, 모형은 88%를 예측했습니다. 순서는 잘 매겼지만 눈금이 높은 쪽으로 어긋났습니다. 저자들은 모형을 재보정하고 이름을 바꿔 단 뒤, 추가 외부 검증이 더 필요하다고 적습니다 (PMID 30322381).

골절 위험 도구에서도 같은 일이 있었습니다. 캐나다 골밀도 등록자료에서 백인 여성 63,632명과 아시아계 여성 1,703명에게 이 도구를 적용했습니다. 백인 여성에서는 위험 층이 높을수록 관측 골절률이 차례로 올라갔습니다. 아시아계 여성에서는, 특히 중간·고위험 층에서 관측 골절률이 대체로 예측보다 낮았습니다. 도구가 이 집단의 위험을 과대추정한 것입니다. 저자들은 이것을 보정 불량으로 진단하고, 위험 과대추정이 환자와 함께 내리는 결정에 영향을 줄 수 있다고 지적합니다 (PMID 36201065).
모형은 순서를 잘 매기면서도 눈금이 틀릴 수 있습니다. 그리고 한 사람 앞에서 쓰는 숫자는 순서가 아니라 눈금입니다.
사전확률을 추정했다면 다음 질문은 이것입니다. 그래서 검사를 할 것인가.
이 질문에 형식을 준 개념이 검사 문턱과 치료 문턱입니다. 검사 문턱은 확률이 그보다 낮으면 검사를 멈추고 치료도 하지 않는 지점이고, 치료 문턱은 확률이 그보다 높으면 검사를 더 하지 않고 치료를 시작하는 지점입니다. 확률이 아주 낮으면 검사 자체가 득보다 실이고, 아주 높으면 검사를 더 해도 결정이 바뀌지 않기 때문입니다. 두 문턱 사이가 검사가 일하는 구간입니다.
패혈성 관절염 개관이 이 계산을 실제로 해 보입니다. 관절액 백혈구 수의 민감도 56%와 특이도 90%를 넣고, 진단에 따르는 위험과 치료의 위험·이득에 대한 최선의 추정치를 함께 넣었습니다. 그러자 관절천자의 검사 문턱은 5%, 치료 문턱은 39%로 나왔습니다. 저자들은 이 값이 자기들이 넣은 가정에서 나온 예시 계산이며, 목적은 그 계산을 해 볼 수 있는 표를 제공하는 데 있다고 명시합니다 (PMID 21843213). 넣은 가정이 달라지면 문턱도 달라집니다.

실제로 어떻게 나타나나
규칙과 임상가의 직관 가운데 어느 쪽이 나은지부터 봅니다. 결과는 깔끔하지 않습니다.
폐색전증에서 눈대중과 예측규칙을 비교한 메타분석(16편·8,306명)에서, 눈대중을 쓴 7편의 낮음·중간·높음 세 구간의 실제 폐색전증 비율은 각각 8~19%, 26~47%, 46~91%였습니다. 예측규칙을 쓴 10편에서는 3~28%, 16~46%, 38~98%였습니다. 둘의 판별 능력은 비슷했습니다. 저자들은 규칙 쪽을 권했는데, 근거는 정확도만이 아니었습니다. 규칙 역시 정확한 것으로 확인됐고, 거기에 경험이 적은 임상가도 쓸 수 있다는 점이 더해졌습니다 (PMID 14657070).
반대 방향의 자료도 있습니다. 응급실에서 폐색전증이 의심된 환자 1,038명(실제 유병률 31.3%)을 후향 분석했더니, 눈대중의 곡선 아래 면적은 0.81로 Wells 점수(0.71)와 개정 Geneva 점수(0.66)보다 높았습니다. Wells 점수와 개정 Geneva 점수는 폐색전증에서 쓰는 대표적인 두 예측규칙입니다. 그런데 같은 논문의 다른 결과가 중요합니다. 세 방법 사이의 일치도는 나빴습니다(모든 κ 값 0.3 미만). κ는 우연히 맞아떨어질 몫을 빼고 잰 일치도입니다. 같은 환자를 놓고 방법마다 다른 확률 구간에 넣었다는 뜻입니다 (PMID 23433653).
어느 한쪽의 완승은 없습니다. 고관절 골절 환자 244명에서 두 예측 모형과 담당 의사의 평가를 비교했더니, 판별력에는 통계적으로 유의한 차이가 없었습니다(곡선 아래 면적 0.73~0.80). 한 모형은 30일 사망 고위험자의 다수를 놓쳤고(민감도 33%), 다른 모형은 체계적으로 과대추정했습니다. 의사들은 고위험자를 더 잘 찾아냈지만(민감도 78%) 역시 과대추정하는 경향이 있었습니다 (PMID 35605101).
중환자실에서도 같은 그림입니다. 유럽 다섯 개 센터에서 인공호흡 중인 중환자 961명을 모았습니다. 간호사·전공의·전문의가 주관적으로 추정한 28일 생존은 객관 지표 62개를 모은 모형만큼 잘 판별했습니다(c 통계량 0.74~0.78 대 0.67~0.72). 그러나 주관적 추정은 보정이 나빴고, 고위험 환자에서 사망을 절대값 기준 약 20%포인트 과대추정했습니다. 저자들의 결론은 이렇습니다. 주관적 추정은 간단하고 비용이 들지 않으며 판별력도 비슷하지만, 과대추정 때문에 살릴 수 있는 치료가 보류될 위험이 있습니다. 그러므로 객관적 도구와 견주어 보고, 둘이 어긋나면 신중히 해석해야 합니다. 이 연구의 또 다른 결과로, 주관적 추정과 객관적 지표를 합쳤을 때 판별이 나아지고 사망 과대추정이 줄었습니다 (PMID 37076881).
이 자료들을 나란히 놓으면 도구의 자리가 보입니다. 예측규칙은 임상가의 판단 옆에 놓고 견주는 도구이고, 둘을 합칠 때 쓸모가 커집니다.
규칙이 진료를 실제로 바꾸는지는 정확도와 따로 재야 하는데, 그것을 잰 연구는 드뭅니다. 이 분야에서 가장 크게 벌어진 틈이 여기입니다.
1차 진료와 관련된 임상 예측규칙의 등록부가 그 틈의 크기를 보여 줍니다. 1965~2009년 문헌에서 논문 745편, 연구 989건을 모았더니, 도출까지 마친 고유한 규칙은 434개였습니다. 그중 검증까지 간 것은 54.8%였고, 진료 과정이나 결과에 미친 영향까지 분석된 것은 2.8%였습니다 (PMID 25024245).

재활 영역도 다르지 않습니다. 요통의 진단 규칙을 모은 리뷰를 8년 뒤 갱신한 판에서 규칙은 11개였습니다. 그사이 새로 나온 다섯 개는 모두 아직 도출 단계였고, 외부 검증을 마친 세 개도 영향 평가가 나오기 전까지는 주의해서 써야 한다고 적혔습니다 (PMID 37807828).
영향 평가가 무엇을 묻는지는 한 예가 보여 줍니다. 둔상 환자에게 흉부 CT를 찍을지 고르는 규칙을 비용-효과 모형으로 분석했습니다. 가상의 1,000명 코호트를 기준으로, 규칙을 쓰면 흉부 CT는 161건 줄고, 임상적으로 유의한 손상은 0.08건 더 놓치며, 비용은 136,432달러 절감된다는 추정이 나왔습니다. 뒤집어 보면, 일상 진료 방식으로 유의한 손상 1건을 더 잡으려면 CT를 2,015건 더 찍어야 한다는 계산입니다 (PMID 31303535).
영향 평가가 묻는 것은 사람이 겪는 일이 얼마나 달라지느냐입니다. 이 예는 그것을 실제 도입 자료 대신 모형으로 추정했습니다.
외부 검증에서 성능, 특히 눈금이 흔들리는 이유는 여럿입니다. 모형이 도출 자료에 과하게 맞춰졌을 수 있고, 환자 구성, 측정 방식, 기저 위험이 다를 수 있습니다. 앞에서 본 실어증 모형과 중환자 모형이 그 전형이었습니다.
기계학습 모형에는 문제가 한 겹 더 있습니다. 대부분 애초에 외부 검증이 되어 있지 않습니다. 정형외과 수술 결과를 예측하는 기계학습 모형 가운데, 만든 자료 안에서만 성능을 확인하는 내부 검증만 거친 모형 59개 중 외부 검증까지 된 것은 10개였습니다. 이를 다룬 18편에서 판별력은 모두 좋게 유지됐지만, 다른 핵심 성능 지표를 보고한 연구가 3편뿐이라 전체 성능을 평가하기 어려웠습니다 (PMID 33870837).
검증까지 마친 규칙조차 진료 현장에 잘 들어가지 못합니다. 이 문제를 정리한 논평은 걸림돌을 진료의 작업 흐름에서 찾습니다. 규칙을 넣을 가장 유력한 자리는 전자의무기록인데, 기반 시설과 조직 차원의 장벽이 큽니다. 그래서 연구의 무게중심을 이미 잘 검증된 규칙의 영향 평가와 실제 도입 방법으로 옮겨야 한다고 주장합니다 (PMID 24236419).
규칙을 쓸지 정하는 데에는 사람 쪽 사정도 끼어듭니다. 심혈관 예측규칙은 1차 진료에서 널리 쓰이는데, 그 진료를 하는 임상가 15명을 심층 면담해 연구 근거가 규칙 사용 결정에 어떻게 작용하는지 탐색한 질적 연구에서 두 갈래가 나왔습니다. 연구 근거에 익숙하고 그것을 신뢰하는 임상가는 근거를 직접 찾아보고 판단해 규칙 사용을 정하는 경향이었습니다. 근거에 익숙하지 않거나, 불신하거나, 활용을 어려워하는 임상가는 근거를 수동적으로 접할 뿐 스스로 판단하지 않는 경향이었습니다. 저자들은 지식과 기술만이 아니라 낯섦·불신·활용의 어려움을 겨냥하는 편이 쓸모 있을 수 있다고 봅니다 (PMID 37730553).
흔한 오해
첫째 오해는 「규칙이 임상가를 대체한다」는 것입니다. 앞 절의 자료가 그대로 답입니다. 폐색전증에서 눈대중과 규칙의 판별력은 비슷했고 (PMID 14657070), 어떤 응급실 자료에서는 눈대중이 더 높았으며 (PMID 23433653), 고관절 골절 사망 예측에서 모형과 의사의 판별력은 통계적으로 다르지 않았습니다 (PMID 35605101).
규칙이 실제로 하는 일은 셋입니다. 규칙은 임상가마다 달랐던 출발점을 같은 자리로 모읍니다. 경험이 적은 사람도 쓸 수 있게 합니다 (PMID 14657070). 그리고 사람 쪽에 남은 체계적 치우침을 견줄 기준이 됩니다. 이 글에서 본 연구들에서는 그 치우침이 위험을 높게 보는 쪽이었습니다 (PMID 37076881, PMID 30630859). 다만 환자와 의사가 생존 가능성을 높게 보는 경향도 보고돼 있어, 치우침의 방향은 연구마다 다릅니다 (PMID 34882175).
둘째 오해는 「곡선 아래 면적이 높으면 좋은 모형이다」는 것이고, 가장 자주 놓치는 오해입니다. 실어증 모형은 판별력이 0.87이었는데 좋은 결과를 68% 대신 88%로 예측했습니다 (PMID 30322381). 중환자 사망 모형들은 판별력은 준수했지만 보정이 나빴습니다 (PMID 36378565). 골절 위험 도구는 한 인구집단에서 위험을 과대추정했습니다 (PMID 36201065).
성능은 판별력과 보정을 함께, 그리고 되도록 외부 검증 자료에서 봐야 합니다 (PMID 34882175). 순서를 잘 매기는 것과 숫자의 눈금이 맞는 것은 다른 일입니다.
셋째 오해는 「개발 논문에 적힌 성능이 내 환자에게도 나온다」는 것입니다. 그대로 나온다고 기대하기 어렵습니다. 앞에서 본 외부 검증들에서 순서를 매기는 힘은 대체로 유지됐지만 눈금은 자주 어긋났습니다 (PMID 36378565, PMID 30322381). 그리고 그 차이가 논문에서 잘 드러나지 않는 이유도 밝혀져 있습니다.
기계학습으로 만든 예측모형 연구 152편의 보고 완전성을 평가했더니, 보고 지침 22개 항목 중 충족한 항목의 중앙값은 38.7%였습니다. 특히 이 모형을 쓸지 말지 판단하는 데 꼭 필요한 정보가 자주 빠졌습니다. 참가자 흐름을 보고한 연구는 3.9%, 모형 명세는 5.2%, 모형의 예측 성능은 5.9%에 그쳤습니다 (PMID 35026997).
해석 자체가 부풀기도 합니다. 종양학 분야 예측모형 연구 62편 가운데 56%가 제목·초록·결과·고찰·결론 어딘가에서 과하게 강한 표현을 썼습니다. 모형끼리 비교할 때 근거로 든 것은 대부분 판별력 지표였습니다(78%) (PMID 36935090).
그래서 논문의 숫자는 「그 저자들이 그 자료에서 관측하고 그렇게 보고한 값」으로 읽어야 합니다.
넷째 오해는 「규칙에는 적용 범위가 없다」는 것입니다. 모든 규칙에는 어떤 환자에게서 만들어졌는가라는 꼬리표가 붙어 있습니다. 그 꼬리표가 곧 규칙의 적용 범위입니다. 어깨 진찰 개관은 자기 결과가 의뢰되지 않은 집단에도 들어맞는지 알 수 없다고 명시했습니다 (PMID 23982370). 일반의 진료의 폐렴 연구는 자기 결과의 일부를 선택 편향, 곧 연구에 들어온 환자가 처음부터 한쪽으로 골라져 결과가 기우는 현상으로 설명합니다 (PMID 3387706).
무엇을 변수로 넣느냐도 선택입니다. 요관결석 예측 점수의 원래 판본에는 인종 항목이 들어 있었습니다. 사회적으로 구성된 정체성인 인종을 임상 알고리즘에 넣는 것의 부작용이 문제로 제기되자, 저자들은 그 항목을 빼고 점수를 다시 만들었습니다. 인종 대신 육안적 혈뇨를 넣은 개정판의 성능은 원래 판본과 사실상 같았습니다. 곡선 아래 면적은 0.85 대 0.86, 오분류율은 0.23 대 0.23이었습니다 (PMID 39524039). 규칙 안에 무엇이 들어 있는지도 따로 들여다볼 대상입니다.
정직한 미해결
어떤 환경에는 숫자가 아예 없습니다. 어지럼 환자의 80% 이상은 일차적으로 일반의에게 진료받고 전문의에게 의뢰되지 않습니다. 그런데 권고되는 진찰 방법들에는 경험적 근거가 없고, 일반의 진료 환경에서 전정질환의 진단정확도 연구가 수행된 적이 아예 없습니다. 그 공백을 메우려는 연구 계획서가 밝힌 사정입니다 (PMID 38569697). 우리가 가진 우도비와 규칙의 상당수는 의뢰된 환자, 곧 이미 걸러진 사람들에게서 나온 값입니다.
유병률 숫자의 출처가 흐립니다. 앞에서 본 Cochrane 리뷰 조사가 그대로 미해결로 남아 있습니다 (PMID 32299367). 사전확률의 첫째 재료부터 정밀하지 않습니다.
만들어진 규칙의 절반 가까이는 검증되지 않았고, 영향까지 평가된 것은 극소수입니다. 434개 규칙 중 검증은 54.8%, 영향 평가는 2.8%였습니다 (PMID 25024245). 기계학습 모형은 외부 검증 자체가 드물고 보고도 불충분합니다 (PMID 33870837, PMID 35026997). 검증을 마친 규칙도 작업 흐름과 기반 시설의 장벽 때문에 현장에 잘 들어가지 못하고 (PMID 24236419), 규칙을 쓸지 말지는 근거에 대한 임상가의 낯섦·불신에도 좌우될 수 있습니다(15명 면담 탐색 연구, PMID 37730553). 세 문제는 종류가 서로 다르고, 셋을 한꺼번에 푸는 방법은 아직 없습니다.
가장 어려운 것은 불확실성을 사람에게 어떻게 말하느냐입니다. 사전확률을 잘 추정했다고 해서 그것을 어떻게 말할지가 저절로 정해지지는 않습니다. 확률을 나타내는 말이 어떤 숫자로 읽히는지 조사한 연구들을 모아 보면, 일반인과 의료인 모두에게서 일관되게 해석된 표현은 다섯 개뿐이었습니다. '매우 가능성 높음'은 90%, '가능성 높음/개연적'은 70%, '가능성 있음'은 40%(범위 30~60%), '가능성 낮음'은 20%, '매우 가능성 낮음'은 10%로 읽혔습니다. 저자들은 확률 표현을 쓸 때 해당 수치 범위를 함께 제시하고, 숫자는 백분율이나 오즈, 분수 대신 "100명 중 몇 명" 형태로 주라고 권합니다 (PMID 38707974). '가능성 있음'이라는 한 단어가 30%와 60% 사이 어디로도 읽힌다는 사실은, 진료실에서 오가는 말의 폭을 그대로 보여 줍니다.
여기에는 정답이 없습니다. 다만 문제에 이름은 붙어 있습니다.
더 깊이 가려면
- 예측규칙 논문을 볼 때 — 먼저 찾을 것은 네 가지입니다. ① 어떤 환자에게서 만들어졌나(어느 환경, 어떤 의뢰 경로, 그 집단의 유병률은 얼마였나) ② 지금 어느 단계인가(도출인가, 외부 검증까지 갔나, 영향 평가가 있나) (PMID 10872017, PMID 21999201) ③ 판별력과 보정을 둘 다 보고했나, 그리고 그것이 외부 자료에서 나온 값인가 (PMID 34882175) ④ 저자들이 스스로 무엇을 아직 아니라고 했나. 좋은 논문일수록 이 문장이 눈에 잘 띕니다.
- 병력과 진찰을 볼 때 — 어떤 소견이 확률을 옮기는지는 재 봐야 압니다. 오래 배워 온 소견이 우도비 1.0에 가까울 수도 있고 (PMID 30708114), 대수롭지 않아 보이는 항목 하나가 확률을 크게 밀 수도 있습니다 (PMID 11754714, PMID 15014046).
- 하나만 남긴다면 — 사전확률은 점이 아니라 범위입니다. 한 사람에 대해 정직하게 말할 수 있는 것은 퍼센트 숫자 하나가 아니라, 이 환경에서 이런 소견을 가진 사람들에서는 대략 이만큼에서 저만큼 사이라는 문장입니다. 병력과 진찰과 예측규칙은 그 범위를 좁히는 도구이고, 범위를 점으로 바꾸지는 못합니다.
근거 논문
설계·집단을 함께 적었다. 본문에 그대로 있는 수치는 되풀이하지 않는다.
출발점이 흔들린다 — PMID 15115422 (2004) 호주·영국 임상가 819명 시나리오 조사 · PMID 24070658 (2014) 흉통·호흡곤란 840명, gestalt와 전산 방식 비교 · PMID 30630859 (2019) 만성 콩팥병 257명, 환자·의사·계산식 3자 비교 · PMID 34740785 (2022) 임상역학 개관.
환경이 확률을 정한다 — PMID 11754714 (2002) 측두동맥염 Rational Clinical Examination · PMID 3387706 (1988) 일반의 의뢰 폐렴 71명, 저자들이 선택 편향을 스스로 적음 · PMID 21843213 (2011) 성인 패혈성 관절염 근거기반 진단(구간 우도비·검사/치료 문턱 예시 계산 포함) · PMID 26682537 (2015) 암스테르담 손목 규칙, 5개 병원 882명 도출·외부 검증 · PMID 29111463 · PMID 29781110 · PMID 29128344 (2018) 같은 279명에게 세 진단을 물은 세 편 · PMID 23982370 (2013) 어깨 회전근개 개관, 전부 의뢰 환자.
유병률 숫자의 출처 — PMID 32299367 (2020) Cochrane 진단정확도 리뷰 59편의 사전확률 출처·선택 방법 조사.
병력과 진찰의 무게 — PMID 9666947 (1998) 우도비와 임상 평가를 나란히 놓은 개관 · PMID 15014046 (2004) 인플루엔자 체계적 문헌고찰 · PMID 30708114 (2019) 의사 51명 설문과 실제 환자 156명 대조.
예측규칙의 3단계 — PMID 10872017 (2000) 근거중심의학 사용자 안내서, 도출·검증·영향과 1수준 정의 · PMID 21999201 (2011) 영향 평가 방법론 틀.
판별력과 보정 — PMID 34882175 (2022) 예후 모형 개발·해석의 핵심 · PMID 36378565 (2023) 중환자 사망 예측 모형 43개 외부 검증 · PMID 30322381 (2018) 뇌졸중 후 실어증 예후 모형 외부 검증 131명 · PMID 36201065 (2022) 캐나다 골밀도 등록자료, 인종 집단별 보정.
규칙과 직관 — PMID 14657070 (2003) 폐색전증 메타분석 16편·8,306명 · PMID 23433653 (2013) 응급실 1,038명 후향 분석, gestalt 우세 · PMID 35605101 (2022) 고관절 골절 244명, 모형 대 의사 · PMID 37076881 (2023) 유럽 5개 센터 인공호흡 중환자 961명, 주관적 추정과 62개 지표 모형.
검증·영향·도입의 틈 — PMID 25024245 (2014) 1차 진료 예측규칙 등록부, 규칙 434개 · PMID 37807828 (2023) 요통 진단 규칙 리뷰 8년 갱신판 · PMID 31303535 (2020) NEXUS Chest CT 영향 분석(비용-효과 모형) · PMID 33870837 (2021) 정형외과 기계학습 모형의 외부 검증 가용성·보고 질 · PMID 24236419 (2012) 도입 실패를 작업 흐름에서 진단한 논평 · PMID 37730553 (2023) 1차 진료 임상가 15명 심층 면담.
논문의 숫자를 읽는 법 — PMID 35026997 (2022) 기계학습 예측모형 152편의 보고 완전성 · PMID 36935090 (2023) 종양학 예측모형 62편의 과대해석 · PMID 39524039 (2024) 인종 항목을 뺀 요관결석 점수 재구성.
남은 구멍 — PMID 38569697 (2024) 일반의 진료 어지럼 진단정확도 연구 계획서(그 환경의 자료가 없다는 서술) · PMID 38707974 (2024) 확률 표현의 수치적 의미 체계적 문헌고찰.