
Paperis 아티클
검사는 무엇을 말해 주나 — 민감도·특이도와 사전확률 입문
같은 검사가 사람마다 다른 뜻이 됩니다 — 검사가 정하는 것과 그 사람이 정하는 것
검사는 무엇을 말해 주나 — 민감도·특이도와 사전확률 입문
"정확도 99%인 검사"라는 말은, 그것만으로는 결과를 받은 사람에게 아무것도 말해 주지 않습니다.
검사지 위의 숫자는 검사에 대한 사실입니다. 결과를 받아 든 사람이 알고 싶은 것은 자기 자신에 대한 사실입니다. 둘은 같지 않습니다. 앞의 것에서 뒤의 것으로 건너가려면, 검사지 어디에도 적혀 있지 않은 정보가 하나 더 있어야 합니다. 그 정보가 사전확률, 곧 검사를 하기 전에 이 사람이 그 병일 확률입니다.
이 글은 그 건너가는 길만 따라갑니다. 길에 놓인 말은 모두 익숙한 것들이지만, 각 말이 처음 나오는 자리에서 정의를 한 번씩 다시 세웁니다.
같은 검사, 두 집단
가상의 검사를 하나 만들어 봅니다. 그 전에 검사의 성능을 말하는 두 비율부터 정의합니다.
민감도는 실제 그 병인 사람을 검사가 양성으로 걸러 낸 비율입니다. 민감도가 99%면, 병이 있는 사람 100명에게 이 검사를 했을 때 99명이 양성으로 나오고 한 명은 놓칩니다. 특이도는 그 병이 아닌 사람을 검사가 음성으로 걸러 낸 비율입니다. 특이도가 99%면, 병이 없는 사람 100명 가운데 99명이 음성으로 나오고 한 명은 헛짚습니다.
우리의 가상 검사는 민감도 99%, 특이도 99%입니다. 흔히 "정확도 99%"라고 부를 만한 검사입니다.
두 비율에는 공통점이 있습니다. 둘 다 누가 병인지 이미 아는 상태에서 거꾸로 센 값입니다. 병이 있는 사람들을 먼저 한쪽에 모아 놓고, 그 사람들에게 검사가 뭐라고 했는지를 셉니다. 진료실에서는 방향이 반대입니다. 앞에 앉은 사람이 어느 쪽인지 모르는 채로 결과부터 받습니다.
누가 병인지는 따로 정한 기준이 가릅니다. 참조표준은 누구를 그 병으로, 누구를 병이 아닌 것으로 볼지 판정하는 기준입니다. 조직검사일 수도, 영상일 수도, 여러 임상의의 합의일 수도 있습니다. 참조표준으로 집단을 병과 병 아님으로 먼저 나누고, 그다음에 평가하려는 검사(지표검사)가 두 집단을 얼마나 잘 갈라내는지를 잽니다 (PMID 33876780). 그래서 이 기준이 흔들리면 민감도도 특이도도 함께 흔들립니다.
이제 이 검사를 두 집단에 써 봅니다. 백분율보다 사람 수로 세면 계산이 빠르고, 사람 수로 제시했을 때 확률 추정이 나아졌다는 결과가 여러 연구에서 나왔습니다 (PMID 26220870).
집단 A — 1,000명 중 10명이 그 병(1%)
- 병이 있는 10명 중 약 10명이 양성
- 병이 없는 990명 중 약 10명이 양성(1%의 헛짚음)
- 양성은 모두 20명, 그중 진짜는 10명 → 양성인 사람이 실제로 병일 확률 ≈ 50%
집단 B — 1,000명 중 300명이 그 병(30%)
- 병이 있는 300명 중 약 297명이 양성
- 병이 없는 700명 중 약 7명이 양성
- 양성은 모두 304명, 그중 진짜는 297명 → ≈ 98%
검사는 똑같습니다. 민감도도 특이도도 바뀌지 않았습니다. 그런데 같은 양성이 집단 A에서는 반반이고, 집단 B에서는 거의 확정에 가깝습니다. 병이 없는데 양성으로 나온 결과를 위양성이라고 하는데, 집단 A에서는 양성의 절반이 위양성입니다.

이 차이에는 이름이 있습니다. 양성예측도는 양성으로 나온 사람이 실제로 그 병일 확률입니다. 음성예측도는 음성으로 나온 사람이 실제로 그 병이 아닐 확률입니다. 두 집단을 가른 1%와 30%는 앞에서 정의한 사전확률입니다. 집단 전체를 놓고 보면 그 집단의 유병률, 곧 그 병을 가진 사람의 비율이 사전확률이 됩니다.
사전확률에서 결과를 받은 뒤의 확률로 옮겨 가는 계산에도 이름이 있습니다. 베이즈 규칙은 사전확률에 검사 결과를 반영해 검사 후 확률로 옮기는 규칙입니다. 검사 후 확률은 사후확률이라고도 합니다. 이 규칙에 따르면 사전확률(= 유병률)과 검사의 측정 성질(민감도·특이도)이 함께 검사 후 확률을 정합니다 (PMID 33741123). 이 글 전체의 뼈대가 되는 구분이 여기서 나옵니다.
| 무엇을 말하나 | 무엇이 정하나 | |
|---|---|---|
| 민감도·특이도 | 병이 있는(없는) 사람에게서 검사가 어떻게 반응하나 | 검사 |
| 양성예측도·음성예측도 | 이 결과가 나온 사람이 실제로 병일 확률 | 검사 + 그 사람이 속한 집단 |
환자가 알고 싶은 것은 언제나 아래 칸입니다. 그리고 아래 칸은 위 칸만으로는 계산되지 않습니다.
스크리닝의 원리를 정리한 고전적 개관은 이것을 이렇게 요약합니다. 유병률이 낮은 상황에서는 아주 좋은 검사도 양성예측도가 나쁩니다. 그래서 대략의 유병률을 아는 것이 선별검사 결과를 해석하는 선결조건입니다 (PMID 11897304).
훈련을 받아도 사라지지 않는 착각
진단 정확도 지표는 의사에게도 헷갈립니다. 전공의 326명에게 이 지표들의 뜻을 묻자 중앙값은 7점 만점에 3점이었습니다. 충수염의 검사 후 확률을 계산하게 하자, 올바르게 추정한 사람은 30명(11.8%)이었고 86.6%는 실제보다 높게 추정했습니다. 수련 연차도, 급성기 외과 경험도, 정보를 어떤 형태로 제시하는지도 결과를 바꾸지 못했습니다 (PMID 26306891). 저자들은 대부분이 병의 확률을 과대추정했고, 그만큼 불필요한 처치와 치료의 위험이 커진다고 적습니다.
다른 연구들도 같은 쪽을 가리킵니다. 24편을 모은 체계적 문헌고찰에서, 정의를 물은 6편을 보면 보건의료인은 우도비, 곧 검사 결과가 확률을 얼마나 옮기는지를 재는 값의 정의를 민감도·특이도의 정의보다 더 자주 틀렸습니다. 양성 결과 뒤의 확률은 과대추정하는 경향이 있었습니다. 우도비로 제시하면 추정이 나아지는지는 결론이 나지 않았습니다. 더 정확해졌다는 연구가 3편, 덜 정확해졌다는 연구도 3편이었습니다. 반면 확률 대신 사람 수로 제시하면 추정과 계산이 나아졌다는 연구는 5편이었습니다. 저자들은 사람 수와 시각 자료를 함께 쓰면 이해를 도울 수 있다고 제안합니다 (PMID 26220870).
통계 훈련도 이 착각을 지우지 못했습니다. 1982년 연구는 통계 훈련을 받은 의사, 개원의, 간호사, 병원 노무직 네 집단에게 조건부확률 문제를 냈는데, 가장 편향된 답을 낸 쪽이 통계 훈련을 받은 의사 집단이었습니다. 유병률 정보를 써야 하는 문제에서는 이들이 다른 집단보다 확실히 나았지만, 그래도 응답 가운데 정확한 것은 34%였고 37%는 유병률 개념을 무시했습니다 (PMID 7157027). 저자들은 집중적인 통계·의사결정 훈련이 임상가의 판단력을 높이는 데 제한적인 가치만 있을 것이라고 결론지었습니다.
최근 자료도 결이 같습니다. 의대생 조사에서 베이즈 추론 과제의 정답률은 41.1%였고, 뇌졸중과 편두통을 가르는 시나리오의 정답률은 48.3%였습니다. 학생들은 진단에서 중요한 요소로 병태생리와 증상을 가장 위에 놓았고, 역학은 9개 중 꼴찌(평균 순위 8.8)에 놓았습니다 (PMID 41840426).
역학을 꼴찌에 놓는 습관에 이 글이 다루는 문제가 다 들어 있습니다. 역학은 사전확률의 가장 큰 재료이고, 사전확률 없이는 검사 결과가 이 사람에게 무엇을 뜻하는지 읽어 낼 수 없습니다.
실제 자료에서도 그렇게 나온다
앞의 1%와 30%는 만들어 낸 숫자입니다. 실제 자료에서도 유병률이 낮으면 양성의 상당수가 헛짚음으로 드러납니다.
한 검사실이 한 달 동안 다룬 호흡기 검체 19,597건 가운데, 처음으로 SARS-CoV-2 RNA가 검출된 것은 52건(0.27%)이었습니다. 이 52건을 다른 플랫폼으로 다시 검사하자 29건(56%)만 재확인됐고 23건(44%)은 확인되지 않았습니다 (PMID 33068757).
특이도가 매우 높아도 양성예측도는 낮을 수 있습니다. 이 자료에서 추정치는 가정한 조건에 따라 달랐는데, 한 상용 검사는 특이도가 99.91~99.98%인데도 양성예측도가 61.8~89.8%였습니다. 자체 개발 검사(특이도 97.4~99.1%)에서는 양성예측도가 20.1~73.8%까지 내려갔습니다. 저자들은 핵산증폭검사가 매우 특이적이라고 결론짓습니다. 그러면서도 유병률이 낮을 때는 처음 양성 가운데 상당수가 재확인되지 않으므로, 확인검사가 위양성 검출을 크게 줄인다고 적습니다. 반대로 사전 검출 확률이 높은 검체에서는 추가 검사를 생략해, 검사를 임상적으로 의미 있는 곳에 모으고 지연을 줄일 수 있다고 덧붙입니다 (PMID 33068757).
유병률이 아주 낮으면 양성예측도가 바닥까지 내려가기도 합니다. 유행 초기 도쿄의 한 병원은 전신마취 수술을 앞둔 무증상 환자 292명에게 PCR과 흉부 CT를 모두 시행했습니다. PCR 양성은 3명이었고, 이 3명의 CT는 모두 음성이었습니다. 그래서 이 자료에서 CT의 민감도와 양성예측도는 둘 다 0%였습니다. 특이도는 96.9%, 음성예측도는 98.9%였습니다. 다만 이 음성예측도는 검사 전부터 병이 없던 사람의 비율과 거의 같아서, CT 음성이 확률을 옮긴 몫은 사실상 없었습니다. 저자들은 그 시기 도쿄처럼 유병률이 낮은 곳에서는 CT 선별이 유용하지 않았고, CT 선별의 시행 기준을 유병률에 근거해 세워야 한다고 결론지었습니다 (PMID 33172767).
얼마나 옮겼는가 — 우도비
지금까지는 사전확률이 결과의 뜻을 바꾼다는 이야기였습니다. 남은 절반은 결과 하나가 확률을 얼마나 옮겼는지를 재는 일입니다.
우도비는 어떤 검사 결과가 병이 있는 사람에게서 나올 가능성이, 병이 없는 사람에게서 나올 가능성의 몇 배인지를 나타내는 값입니다. 우도비가 1이면 그 결과는 확률을 전혀 옮기지 못합니다. 1보다 크면 병이 있는 쪽으로, 작으면 반대쪽으로 확률을 밉니다.
우도비는 집단 사이에 옮겨 쓸 수 있습니다. 예측도는 유병률을 품고 있어서, 다른 연구에서 잰 값을 내 앞의 사람에게 그대로 가져오면 틀립니다. 우도비는 그렇지 않아서, 다른 집단에서 잰 우도비를 내 환자의 사전확률과 결합해 검사 후 확률을 얻을 수 있습니다 (PMID 36202637). 방법론 개관도 사전확률과 검사 후 확률을 가장 잘 잇는 값으로 우도비를 꼽습니다 (PMID 15827842).
우도비는 양성과 음성 두 값으로만 매길 필요도 없습니다. 결과가 수치로 나오는 검사라면 값의 구간마다 우도비를 따로 매길 수 있습니다. 그러면 결과를 양성과 음성으로 뭉개면서 버리던 정보를 살릴 수 있습니다.
구간별 우도비는 이 글의 축을 가장 깨끗하게 보여 줍니다. 폐색전증 진단연구 다섯 편에서 환자 한 명 한 명의 원자료를 모아, D-이량체 값을 여덟 구간(경계 250·500·750·1,000·1,500·2,500·5,000 ng/mL)으로 나누고 구간별 우도비를 추정한 결과는 이렇습니다.
- 1,000~1,499 ng/mL 구간의 우도비는 0.98(95% 신뢰구간 0.82–1.18)로 사실상 1이었습니다. 이 구간의 값은 확률을 거의 옮기지 않습니다.
- 구간이 하나 올라갈 때마다 우도비가 일정한 배수로 커진다고 놓은 모형에서, 그 배수는 약 2배(구간 간 상수 2.0, 95% 신뢰구간 1.9–2.1)였습니다.
- 검사 전 확률이 15%인 사람은 D-이량체가 500 미만이어야 검사 후 확률이 3% 아래로 내려갔습니다. 검사 전 확률이 5%인 사람에게는 1,000이 그 경계였습니다 (PMID 28370759).
같은 검사 값이라도, 어떤 값을 "음성"으로 볼지는 검사지가 아니라 그 사람의 사전확률에 달려 있습니다. 다만 이 숫자들은 그 다섯 편의 자료에서 계산한 근사값입니다. 저자들도 이 값에 근거한 판단 전략이 이미 발표된 여러 전략과 대체로 일치한다는 선에서 결론을 맺습니다.

문턱은 용도와 가치가 정한다
수치로 나오는 검사를 양성과 음성으로 나누려면 어딘가에 선을 그어야 합니다. 그 선을 문턱, 또는 절단점이라고 합니다. ROC 곡선은 문턱을 낮은 쪽에서 높은 쪽으로 옮겨 가며, 문턱마다 민감도와 (1−특이도)를 찍어 이은 그림입니다. 괄호 안의 값은 병이 없는 사람 가운데 양성으로 나온 비율입니다. 곡선 아래 면적은 검사가 두 집단을 얼마나 잘 갈라 놓는지를 하나의 숫자로 요약한 값입니다.
연속 수치 검사에서는 민감도와 특이도가 서로 반대 방향으로 움직입니다. 문턱을 낮추면 더 많이 잡아내지만 더 많이 헛짚고, 올리면 그 반대입니다. 그래서 선을 어디에 그을지는 틀린 결과가 임상적으로 어떤 대가를 치르게 하는지를 보고 정해야 합니다 (PMID 11897304). 곡선은 가능한 조합의 목록일 뿐이고, 그중 어느 점을 고를지는 말해 주지 않습니다.

어느 점을 고를지는 형식적으로 정리돼 있습니다. 최적 문턱은 기대 효용을 가장 크게 만드는 문턱입니다. 그 문턱은 질병의 사전확률(오즈로 나타낸 값)과 "민감도가 특이도에 비해 얼마나 중요한가"로 정해지고, ROC 곡선 위에서 기울기가 그 값과 같아지는 점이 그 문턱입니다 (PMID 21570638). 병일 가능성이 높을수록, 그리고 병을 놓치는 대가가 클수록 문턱은 더 민감한 쪽으로 옮겨 갑니다. 사전확률은 결과를 해석할 때뿐 아니라 문턱을 고를 때도 계산 안에 들어 있습니다.
같은 값어치를 갖는 민감도·특이도 조합들을 이은 선을 무차별곡선이라고 합니다. 저자들의 정리는 이 두 곡선 위에 섭니다. ROC 곡선은 무엇이 가능한지를 보여 주고, 무차별곡선은 무엇이 바람직한지를 보여 줍니다. 둘을 겹쳐야 무엇을 골라야 하는지가 나옵니다 (PMID 21570638).
결핵균 피부반응검사가 이 말을 실제 숫자로 보여 줍니다. 원발 정확도 연구가 아니라 역학 조사 자료를 모형으로 다시 계산한 연구에서, 미국 일반 인구 기준 양성예측도는 절단점에 따라 0.44~1.0으로 움직였습니다. 그렇게 얻은 곡선 아래 면적은 0.997로 대단히 높았는데도, 최적 절단점은 유병률과 검사의 목적에 따라 2 mm에서 16 mm까지 벌어졌습니다 (PMID 8583267). 검사가 좋다는 것과 어디에 선을 그을지는 별개의 문제입니다.
최근 예도 같은 쪽을 가리킵니다. 규폐증 판독을 돕는 컴퓨터 보조 검출 시스템에서, 전직 금광 광부의 흉부 X선 501장 자료에 두 기준을 대 봤습니다. 하나는 Youden 지수(민감도와 특이도의 합이 가장 큰 점을 고르는 기준)이고, 다른 하나는 민감도 최소 90% 보장입니다. 두 기준에서 도출되는 문턱이 서로 달랐고, 규폐증의 정의와 판독자에 따라서도 달라졌습니다. 가정하는 유병률을 바꾸면 양성예측도가 크게 달라졌고, 그만큼 위양성의 비율이 바뀌었습니다. 저자들은 그 함의를 세 가지 용도, 곧 재직 광부의 정기 검진, 퇴직 광부를 찾아가는 아웃리치 검진, 보상 청구 심사로 나눠 설명하고, 사용자가 먼저 용도, 민감도와 특이도 사이에서 무엇을 더 중시할지, 규폐증의 정의를 정하고 유병률의 영향도 따져야 한다고 결론짓습니다 (PMID 40188380). 같은 시스템과 같은 영상이라도, 용도가 다르면 맞는 문턱이 달라집니다.
문턱을 정하는 것은 그 검사를 누가 어떤 목적으로 쓰는가입니다.
사전확률이 검사 선택까지 정한다
사전확률은 결과 해석만이 아니라 어떤 검사를 고를지도 바꿉니다.
안정형 협심증에서 비침습 검사마다, 유의한 관상동맥 협착을 확진(검사 후 확률 >85%)하거나 배제(<15%)할 수 있는 사전확률 구간이 따로 있습니다. 침습 관상동맥조영술을 참조표준으로 삼은 132편·28,664명의 메타분석에서, 운동부하 심전도는 사전확률이 ≥80%일 때만 확진 쪽으로, ≤19%일 때만 배제 쪽으로 쓸 수 있었습니다. 사전확률이 그 사이인 환자에게는 확진도 배제도 하지 못한다는 뜻입니다. 관상동맥 CT 조영은 사전확률 ≥58%에서 확진, ≤80%에서 배제가 가능했습니다.
여기까지는 조영술에서 눈으로 판정한 해부학적 협착을 기준으로 한 값입니다. 기준을 기능적 협착, 곧 혈류예비량비(협착이 실제로 혈류를 얼마나 줄이는지를 재는 값)로 잰 협착으로 바꾸면, 같은 CT의 구간이 ≥75%·≤57%로 좁아졌습니다. 저자들은 검사 선택이 그 환자의 사전확률 구간과 어떤 참조표준을 쓰느냐에 근거해야 한다고 결론짓습니다 (PMID 29850808).
검사가 실제로 하는 일 — "모르겠다" 구간 줄이기
확률을 옮긴다는 말은 추상적으로 들리지만, 잘 옮기면 환자가 겪을 일이 바뀝니다.
신장 이식 뒤 거부반응을 감시하는 혈액 검사(공여자 유래 무세포 DNA)가 그 예입니다. 922개 검체에서, 검사 전 위험이 중간 구간(10~30%)이던 345개 검체 가운데 253개가 검사 뒤 다른 구간으로 재분류됐습니다. 옳게 옮겨간 것은 낮은 위험 쪽이 72%(117/162), 높은 위험 쪽이 36%(33/91)였습니다. 조직검사 문턱을 10%로 잡으면 482건의 조직검사를 안전하게 피할 수 있었다는 계산이 나왔고, 그중 91%가 정기 프로토콜 조직검사였습니다. 거부반응 유병률이 비교적 낮은 코호트의 값입니다 (PMID 42133430).

이 검사가 한 일은 진단을 내리는 것보다 "모르겠다" 구간을 줄이는 것이었습니다.
선별검사도 잘 설계되면 제 몫을 합니다. 신생아 청각선별을 시행한 기간과 시행하지 않은 기간을 병원별로 번갈아 배치해 비교한 연구에 아기 53,781명이 포함됐습니다. 선별 기간에는 비선별 기간보다 중등도 이상 난청 아기가 10만 명당 71명 더 생후 6개월 이전에 의뢰됐습니다. 병이 있는데 음성으로 나온 결과인 위음성의 비율도 4%로, 기존 방문검사(27%)보다 낮았습니다 (PMID 10626585). 저자들은 이른 관리가 가장 큰 이득을 줄 수 있는 중등도·고도 난청 아기에게 이 선별이 특히 쓸모 있을 수 있다고 봅니다.
위양성이 부르는 것
검사가 확률을 잘 옮기는 자리가 있는 만큼, 사전확률이 낮은 자리에서는 위양성이 일을 만듭니다.
우연히 발견된 부신·뇌하수체 종괴에서 이 문제가 잘 드러납니다. 임상적으로 진단되는 호르몬 분비 종양은 우연히 발견되는 종괴보다 훨씬 드뭅니다. 효과적인 호르몬 선별검사에는 위양성의 수를 제한할 만큼 충분히 높은 사전확률이 필요합니다. 그렇지 않으면 위양성을 쫓아가는 동안 비용과 위해가 이어집니다. 이 개관의 저자들은 이것을 Mold와 Stein의 표현을 빌려 "사건들의 연쇄 — 진행할수록 가속이 붙어, 멀리 갈수록 멈추기 어려워지는" 일이라고 부릅니다 (PMID 9074861).
이 연쇄는 실제로 관찰됩니다. 무증상인 사람에게 혈청 종양표지자를 암 선별에 쓴 38편의 체계적 문헌고찰에서, 일반 무증상 집단의 양성예측도는 일관되게 낮았습니다. 위양성은 자주 영상검사·침습적 시술·수술로 이어졌고, 합병증 발생률은 최대 15%였습니다. 대규모 무작위 시험들에서 사망률 이득은 확인되지 않았습니다. 저자들은 특정 하위집단(예: 새로 발병한 당뇨에 CA 19-9 상승)에서는 양성예측도가 나아졌다고 적으면서도, 인구 집단 선별을 뒷받침하기에는 근거가 불충분하다고 결론짓습니다 (PMID 42522803).
선별검사에는 고유한 위험도 있습니다. 찾아내지 않았어도 해를 끼치지 않았을 병을 찾아내는 것이고, 이를 과진단이라고 합니다. 일본의 영아 신경모세포종 선별을 검토한 1994년 개관에서, 추가 검사를 부르는 위양성은 0.1% 미만이었고 선별로 발견된 아이의 생존율은 90%를 넘었습니다(증상으로 발견된 경우 약 50%). 그런데 생물학적 표지자로 보면 선별로 잡히는 종양은 원래 예후가 좋은 쪽이었고, 예후가 나쁜 종양 일부는 선별을 통과해 버렸습니다. 저자들은 그 시점의 근거로는 선별로 막을 수 있는 사망은 적고 과진단 가능성은 크다고 보고, 추가 근거가 나오기 전에는 선별을 권고할 수 없다고 결론지었습니다 (PMID 8790511).
생존율이 좋아 보이는 것과 사망이 줄어드는 것은 다른 이야기입니다. 진단 시점만 앞당겨도 진단부터 사망까지의 기간은 길어지고, 천천히 자라는 병은 선별에 더 잘 걸립니다. 이 두 착시를 피할 방법은 무작위 시험뿐입니다. 앞에서 유병률과 양성예측도의 관계를 인용한 스크리닝 개관은, 선별이 건강을 개선할 수 있다는 것도 함께 적습니다. 자궁경부 세포검사 프로그램과 자궁경부암 사망 감소를 잇는 간접 근거는 강합니다 (PMID 11897304).
흔한 오해
첫째 오해는 "정확도가 높으면 믿을 만하다"는 것입니다. 특이도 99.9%대의 검사에서도 양성예측도가 61.8~89.8%로 내려앉았고 (PMID 33068757), 무증상 수술 전 환자 292명에서는 CT의 양성예측도가 0%가 됐습니다 (PMID 33172767). 정확도는 검사의 속성이고, 그 결과를 믿을 만한지는 누구에게 썼는지가 함께 정합니다 (PMID 11897304).
둘째 오해는 "음성이면 아니다"입니다. 음성 결과가 병을 얼마나 배제해 주는지는 그 사람의 사전확률에 달려 있습니다. 폐색전증에서 각 검사의 우도비를 정리한 개관에 따르면, 사전확률이 높은 사람은 CT 폐동맥조영이 음성이어도 검사 후 확률이 여전히 10%를 넘습니다. 반대로 사전확률이 17% 미만인 사람은 D-이량체가 음성(음성 우도비 0.05)이면 검사 후 확률이 1% 아래로 내려갑니다. 같은 개관은 한 검사의 검사 후 확률이 다음 검사의 사전확률이 되면서, 검사를 거듭할수록 최종 진단까지의 간격이 좁아진다고 덧붙입니다 (PMID 16091094).
확진에 쓰이는 검사도 병을 놓칠 수 있습니다. 거대세포동맥염이 새로 의심되어 의뢰된 381명에게 초음파와 측두동맥 생검을 모두 시행한 연구에서, 생검의 민감도는 39%(특이도 100%)로 이전 보고보다 유의하게 낮았습니다. 같은 연구에서 2주 시점의 임상 판단을 생검과 조합한 전략은 민감도 91%, 특이도 81%를 보였습니다. 검사 하나로는 못 하는 일을 조합이 하지만, 그 대가로 특이도를 일부 내준 셈인데, 이 연구의 참조 진단 자체가 임상 소견과 생검을 함께 쓰므로 이 값은 뒤의 「정직한 미해결」에서 다루는 참조표준의 한계와 함께 읽어야 합니다 (PMID 27925577).
반대로 민감도가 높은 검사도 음성의 무게는 생각보다 가벼울 수 있습니다. 전부 비1차진료 수술 증례군을 모은 하지직거상 검사 메타분석(참조표준 = 수술)에서는 민감도가 0.91로 높은 대신 특이도가 0.26이었습니다 (PMID 10788860). 특이도가 이만큼 낮으면 음성 결과가 확률을 내리는 폭도 그만큼 줄어듭니다. 음성 결과가 말하는 것은 "확률이 이만큼 내려갔다"입니다.
셋째 오해는 "민감도·특이도는 검사에 붙은 고정 상수다"이고, 가장 자주 놓치는 대목입니다. 민감도와 특이도는 교과서에서 검사의 성질로 배우지만, 실제 자료에서는 유병률에 따라 움직입니다.
Cochrane 데이터베이스의 진단 정확도 메타분석에서 뽑은 6,909편에서, 유병률 최고 4분위는 최저 4분위에 비해 민감도의 오즈가 1.47배 높았고 특이도의 오즈는 0.47배였습니다 (PMID 37460126). 오즈는 어떤 일이 일어날 확률을 일어나지 않을 확률로 나눈 값입니다. 여기서 몇 배라는 값은 두 오즈를 나눈 값, 곧 오즈비입니다. 풀어 말하면 유병률이 높은 연구일수록 민감도는 높게, 특이도는 낮게 추정됐습니다.
이유는 두 갈래입니다. 하나는 임상적 변이입니다. 유병률이 높은 집단에는 더 중증인 환자가 섞일 수 있고, 그러면 검사가 더 잘 작동합니다. 다른 하나는 인위적 변이입니다. 연구 설계, 특히 지표검사 결과에 따라 누구를 참조표준으로 확인했는지가 유병률과 정확도를 함께 흔듭니다 (PMID 18778913). 그래서 저자들은 임상가에게 자기 상황과 가장 닮은 집단에서 나온 연구를 골라 판단의 근거로 삼으라고 권합니다.
그렇다고 "1차 진료에서는 항상 이렇다"는 규칙이 있는 것도 아닙니다. 의뢰 전 진료와 의뢰 후 진료를 비교한 메타역학 연구에서, 13개 검사의 민감도·특이도 차이는 방향도 크기도 제각각이었습니다. 저자들은 검사와 대상 질환에 따라 달라질 뿐 보편적 패턴은 없다고 결론지었습니다 (PMID 40339825).
넷째 오해는 "검사는 많이 할수록 안전하다"입니다. 진단검사 과사용을 평가한 35편·118건을 모으면, 과사용 추정치는 0.09%에서 97.5%까지 흩어집니다(적응증 기준 중앙값 11.0%). 대부분은 25% 미만이었습니다. 25% 이상으로 높게 나온 33건에서 가장 자주 평가된 대상은 수술 전 검사(7건)와 단순 요통에 대한 영상검사(6건)였습니다 (PMID 33972387). 저자들은 무엇을 과사용으로 정의하고 어떻게 쟀는지가 연구마다 달라 추정치가 이렇게 흩어졌을 것으로 봅니다.
반복 검사도 같은 결입니다. 잉글랜드 1차 진료의 전립선특이항원 검사를 2000~2018년 자료로 본 코호트에서, 최소 한 번 검사받은 152만 명 가운데 48.4%가 여러 번 검사받았습니다. 그중 72.8%는 연령별 의뢰 문턱을 한 번도 넘은 적이 없었습니다. 중앙 재검사 간격은 12.6개월이었습니다 (PMID 41062172). 저자들은 여러 번 검사받은 사람 가운데 상당수가 권고보다 자주 검사받아 과잉 검사가 우려된다고 적습니다.
다섯째 오해는 "결과가 확률을 확정한다"입니다. 검사 결과는 확률을 갱신할 뿐 확정하지 않습니다. 앞의 D-이량체 자료가 그 말을 그대로 보여 줍니다. 같은 값이 어떤 사람에게는 배제가 되고 어떤 사람에게는 배제에 이르지 못합니다. 결과가 하는 일이 출발점에서 확률을 옮기는 것이기 때문입니다.
정직한 미해결
첫째 미해결은 참조표준이 완벽하지 않다는 것입니다. 민감도와 특이도는 참조표준, 곧 누가 병인지 판정하는 기준 위에서 잰 값입니다. 그 기준이 흔들리면 그 위의 값도 흔들립니다.
참조표준이 불완전하면 ROC 곡선 추정이 편향되고, 사전확률과 검사 후 확률을 잇는 우도비까지 편향됩니다. 모의자료 연구는 철결핍을 트랜스페린 포화도로 진단하는 예에서, 유병률과 지표검사–참조표준 사이의 상관에 따라 우도비가 임상적으로 의미 있을 만큼 뒤틀릴 수 있음을 보였습니다 (PMID 40650984).
앞의 거대세포동맥염 연구가 그 사례입니다. 저자들은 독립적인 금본위 진단이 없다는 점을 한계로 밝혔습니다. 금본위는 그 병을 다른 검사와 무관하게 확정해 주는, 가장 믿을 만한 참조표준을 말합니다. 그 연구의 참조 진단 자체가 임상 소견과 생검 결과를 함께 쓰는 분류 기준이었습니다. 저자들은 초음파와 생검 모두 판독자 사이의 일치도가 중간 정도였다는 결과가, 양성 생검이 언제나 그 병을 뜻한다는 가정에 의문을 던진다고 적습니다 (PMID 27925577).
정확도 연구의 설계도 값을 흔듭니다. 참조표준을 누가 받았는지가 값을 바꿉니다. 참가자 일부만 참조표준으로 확인되면 값이 왜곡되는데, 특히 지표검사가 양성인 사람이 확진검사(= 참조표준)를 받을 가능성이 더 높을 때 그렇습니다. 이 문제를 다룬 논문의 결론이 핵심을 짚습니다. "어떤 소견이 이미 누가 확진검사를 받을지를 정하는 데 쓰였다면, 확진검사를 받은 사람들만 놓고 그 소견의 유용성을 평가할 수는 없다." (PMID 35124189)
이 문제는 실제 연구에서도 드러납니다. 앞의 하지직거상 검사 메타분석에서는 지표검사와 참조표준을 모두 눈가림한 연구처럼 설계가 더 타당할수록 판별력이 낮게 나왔습니다. 저자들은 포함된 연구들로는 이 검사들의 정확도를 타당하게 평가할 수 없다고 결론짓습니다 (PMID 10788860).
가장 큰 미해결 — "이 검사를 해야 하는가"
지금까지 이야기한 것은 전부 확률에 관한 것입니다. 검사를 할지 말지는 확률만으로 답이 나오지 않습니다.
진단검사의 합리적 사용을 다룬 개관이 이 점을 정리합니다. 정확도 연구는 대부분 한 시점에 검사와 참조표준을 함께 재는 단면 설계이고, 진단 전략끼리 비교한 무작위 시험은 드뭅니다. 단면 연구가 재는 정확도 지표는 환자에게 돌아가는 실제 이득을 정의하기에는 간접적이고 불충분합니다. 그 지표들 가운데서는 양성·음성 우도비가 임상 관리에 가장 쓸모 있습니다. 저자들은 그 방법론을 아는 것이 기본이지만 충분하지 않다고 결론짓습니다. 그리고 결정에는 비용, 결과가 나오기까지의 시간, 환자의 선호와 가치가 함께 들어가는 편이 좋다고 적습니다 (PMID 30994847).
더 깊이 가려면
- 정확도 논문을 읽을 때는 네 가지를 먼저 찾습니다. ① 누구를 모았나(그 집단의 유병률은 얼마이고, 내 앞의 사람과 닮았나) ② 참조표준은 무엇이었나 ③ 누가 그 참조표준을 받았나(전원인가, 지표검사 양성자 위주인가) ④ 문턱은 어떻게 정해졌나(그 용도가 내 용도와 같은가) (PMID 33876780).
- 숫자를 볼 때는 백분율을 사람 수로 바꿔 봅니다. "1,000명 중 몇 명"으로 놓으면 위양성의 크기가 눈에 보입니다 (PMID 26220870).
- 예측도와 우도비를 구분합니다. 다른 연구의 양성예측도는 내 집단으로 옮겨 쓸 수 없지만, 우도비는 내 환자의 사전확률과 결합해 쓸 수 있습니다 (PMID 36202637). 다만 우도비도 민감도·특이도로 만들어지고, 흔한 오해의 셋째에서 보듯 그 둘이 유병률에 따라 움직입니다. 그래서 우도비도 완전히 자유롭지는 않고, 여기서도 내 상황과 가장 닮은 집단의 값을 고르는 것이 맞습니다 (PMID 18778913).
- 하나만 남긴다면 이것입니다. 검사는 답이 아니라 확률을 옮기는 도구입니다. 얼마나 옮기는지는 검사가 정하고, 어디에서 출발하는지는 그 사람이 정합니다.
이 글이 남기는 것은 결과지의 숫자 하나가 왜 그것만으로는 답이 되지 못하는지에 대한 이해입니다. 그래서 한 사람의 결과는 그 사람의 사전확률과 함께 읽힐 때 비로소 뜻을 갖습니다. 검사가 옮긴 확률이 결국 환자에게 무엇이 되는가는 「좋아진 숫자와 나아진 환자 — 대리 지표 입문」이 따라갑니다.
마지막으로 이 글이 일부러 비워 둔 자리가 있습니다. 출발점, 곧 사전확률은 검사지 어디에도 적혀 있지 않습니다. 그것은 그 사람의 나이·증상·경과·다른 소견, 그리고 그가 어떤 경로로 이 검사에 도달했는지에서 나옵니다. 그 재료를 모아 하나의 숫자로 만드는 일, 곧 병력과 진찰이 확률을 얼마나 옮기는지와 임상 예측규칙이 어떻게 도출되고 검증되는지는 「사전확률은 어디서 오는가 — 병력과 진찰, 그리고 임상 예측규칙」이 이어 받습니다.
근거 논문
설계·집단을 함께 적었다. 등급은 review-notes.md.
개념 — PMID 33741123 (2021) 베이즈 규칙 해설 · PMID 11897304 (2002) 스크리닝 개관. 선별이 건강을 개선할 수 있다는 것도 적는다(자궁경부 세포검사–사망 감소, 강한 간접 근거) · PMID 15827842 (2005) 방법론 개관 · PMID 36202637 (2023) 완화의료 개관, 우도비의 한계도 다룬다 · PMID 33876780 (2022) 설계 개관.
얼마나 틀리는가 — PMID 26306891 (2016) 전공의 326명 · PMID 26220870 (2015) 문헌고찰 24편. 우도비 제시의 효과는 엇갈림(더 정확 3편/덜 정확 3편) · PMID 7157027 (1982) 네 집단 169명 · PMID 41840426 (2026) 의대생 단면 조사(표본 수 미표기).
저유병률 실측 — PMID 33068757 (2021) 단일 검사실 1개월 19,597검체(위 수치는 가정 모수별 점추정 범위) · PMID 33172767 (2021) 도쿄 단일 병원, 수술 예정 무증상 292명 후향 분석.
우도비 — PMID 28370759 (2017) 폐색전증 연구 5편 통합 · PMID 16091094 (2005) 개관.
문턱 — PMID 21570638 (2011) 방법론. 널리 쓰이는 두 어림 규칙은 특수한 경우에만 최적 · PMID 8583267 (1995) 역학 자료 재계산·베이즈 분석(미 해군 신병·WHO 조사). 민감도 0.59~1.0 · PMID 40188380 (2025) 분석적 방법론, 광부 흉부 X선 501장의 기존 ROC 자료. 규폐증 CAD는 결핵 CAD보다 개발 단계가 이르고 전문 판독에 기대 검증된다고 명시.
진료에서 — PMID 29850808 (2018) 메타분석, 침습 조영술 참조 132편·28,664명 + 혈류예비량비 참조 23편·4,131명 · PMID 42133430 (2026) 관찰 코호트 922검체, 거부반응 저유병률. 곡선 아래 면적 검사 단독 0.79~0.80·임상 정보 결합 0.82~0.87 · PMID 10626585 (1999) 기간 교차 배치 비교 연구, 영아 53,781명. 위알람률 1.5%, 수확량은 양측 40 dB 이상 난청 10만 명당 90례(기대 유병률의 80%) · PMID 9074861 (1997) 내분비 개관. 추가 평가의 주된 정당화가 음성으로 확인된 사람을 안심시키는 것에 가깝다고도 적는다 · PMID 42522803 (2026) 체계적 문헌고찰 38편(무증상 집단). 일부 하위집단은 양성예측도가 개선되나 인구 선별 근거는 불충분 · PMID 8790511 (1994) 일본 전국 프로그램 근거 개관(소변 VMA·HVA).
값이 흔들리는 이유 — PMID 37460126 (2023) Cochrane 552 메타분석의 6,909편 · PMID 18778913 (2009) 기전 · PMID 40339825 (2025) 메타역학 9편·13종(징후·증상 7종 민감도 +0.03~+0.30, 생체표지자 4종 −0.11~+0.21, 영상 1종 −0.22).
오해가 임상에서 만드는 것 — PMID 27925577 (2016) TABUL, 의뢰 381명 2차 진료. 초음파는 민감도 54%·특이도 81%로 생검(39%·100%)보다 민감도가 높고 특이도가 낮다. 전원 초음파 후 음성만 생검 시 생검 43% 감소 · PMID 10788860 (2000) 체계적 문헌고찰 11편(참조표준=수술). 교차 하지직거상은 민감도 0.29·특이도 0.88으로 정반대 · PMID 33972387 (2022) 35편의 118개 평가 · PMID 41062172 (2025) 잉글랜드 일차진료 남성 1,023만 명.
참조표준·설계의 미해결 — PMID 35124189 (2022) 방법론(해법은 양성자 전원 + 음성자 무작위 표본) · PMID 40650984 (2025) 모의자료 · PMID 30994847 (2019) 개관.
본문에서 덜어낸 값 — PMID 27548805 (2016)은 정확도만으로 결론이 안 날 때 위양성 중 불필요한 추가 검사를 겪는 인원까지 세는 진단 수율 틀을 제안하며, 기대 효용을 유병률과 두 오류의 상대적 중요도로 가중된 정확도로 쓴다 · PMID 23798453 (2013)은 23개 메타분석(416편)에서 유병률을 최저→최고로 옮기면 민감도나 특이도가 0~40%포인트 움직였다고 보고하되 특이도만 일관됐고 민감도에는 체계적 효과가 없었다 — 위 6,909편 연구와 결이 다르다 · PMID 23958378 (2013)은 설계·관찰자 변이·임상 정보·참조표준·검증 편향·유병률과 중증도에서 일관된 효과의 근거를 찾았고, 효과가 특이도보다 민감도에서 더 강했다고 보고한다.