
Paperis 아티클
같은 결과, 다른 문장 — 형식이 판단을 바꾸는 자리와 바꾸지 못하는 자리
덴마크의 23개 진료소를 무작위 배정해 같은 시험 결과를 두 형식으로 설명하게 했더니, 처방전을 실제로 받아 간 환자가 5.4%와 25.0%로 갈렸다. 두 설명 모두 정확한 옮김이었고, 이 시험이 잰 것은 조제율과 결정 확신·소통 만족도까지다.
같은 결과, 다른 문장 — 형식이 판단을 바꾸는 자리와 바꾸지 못하는 자리
같은 약, 같은 시험 결과입니다. 달랐던 것은 의사가 환자에게 그것을 설명한 문장뿐입니다.
이야기는 덴마크의 진료소 23곳에서 시작합니다. 이곳의 일반의 34명이 환자에게 콜레스테롤강하 치료의 효과를 설명했습니다. 한쪽 진료소들은 치료로 수명이 얼마나 늘어나는가로, 다른 쪽 진료소들은 위험이 얼마나 줄어드는가로 설명했습니다. 어느 진료소가 어느 설명을 쓸지는 진료소 단위의 무작위 배정, 곧 제비뽑기로 정했습니다. 분석에 든 환자는 240명(112명 대 128명)입니다. 처방전을 실제로 약국에서 받아 간 사람은 수명으로 설명을 들은 쪽에서 6명(5.4%), 위험 감소로 설명을 들은 쪽에서 32명(25.0%)이었습니다. 결정에 대한 확신과 소통 만족도는 두 형식 사이에 차이가 없었습니다 (PMID 24686884). 같은 효과를 다른 문장으로 말했을 뿐인데, 약을 받아 간 사람의 비율이 크게 갈렸습니다.

이 결과를 읽을 때 놓치기 쉬운 점이 둘 있습니다. 첫째, 두 설명은 모두 같은 시험 결과를 정확히 옮긴 것입니다. 어느 쪽도 거짓이 아닙니다. 둘째, 이 시험이 잰 것은 처방전을 받아 간 비율(조제율)과 확신·만족도입니다. 그 뒤 환자들에게 무슨 일이 있었는지는 재지 않았습니다. 그래서 어느 형식이 옳은 결정을 이끄는지도, 이 치료가 얼마나 이로운지도 이 시험으로는 알 수 없습니다. 갈린 것은 사람의 반응입니다.
이 글은 그 반응을 다룹니다. 묻는 것은 셋입니다. 첫째는 형식이 판단을 얼마나 바꾸는지, 둘째는 그 바뀜이 어디서 나타나고 어디서 나타나지 않는지, 셋째는 논문의 문장이 보도자료와 기사로 옮겨 가며 어떻게 한 번 더 커지는지입니다. 새로 배울 말은 넷이고, 각 말은 처음 나오는 자리에서 풉니다. 결론을 미리 한 줄로 말하면 이렇습니다. 형식은 판단을 바꿉니다. 다만 늘 이기지는 않습니다.
⚠️ 아래 나오는 약과 검사와 수술의 이름은 전부 숫자를 읽는 법을 보이기 위한 사례입니다. 무엇이 좋고 나쁜지에 대한 판단이 아니고, 각 숫자는 그 연구의 설계와 대상 안에서만 뜻을 갖습니다.
앞 편에서 배운 말 다시 보기
이 글은 「위험이 절반으로 줄었다면, 몇 명이 덜 아픈가 — 상대위험과 절대위험」과 「"위험 50% 감소"는 몇 명인가 — 상대위험·절대위험·NNT를 읽는 법」에서 다룬 말을 그대로 씁니다. 짧게 다시 적습니다.
기저위험은 아무것도 하지 않았을 때 그 일이 원래 일어나던 비율입니다. 치료가 이 비율을 얼마나 줄였는지는 두 가지로 적을 수 있습니다. 원래 비율에 견줘 몇 퍼센트가 줄었는지로 적으면 상대위험감소이고, 줄어든 만큼을 그대로 빼서 적으면 절대위험감소입니다. 위험 자체도 같은 방식으로 상대위험과 절대위험으로 나뉩니다. NNT는 한 사람이 이득을 보기까지 몇 명을 치료해야 하는지 센 값입니다.
이 말들이 남긴 요점은 하나입니다. 같은 결과를 상대적으로 적으면 크게 보이고 절대적으로 적으면 작게 보입니다. 그 둘을 잇는 고리가 그 인구의 기저위험입니다. 이 글은 그다음 질문을 맡습니다. 숫자를 이렇게 다르게 적으면 읽는 사람의 판단이 실제로 달라지는가입니다.
프레이밍 — 형식이 고르는 세 가지
프레이밍은 같은 사실을 어떤 문장으로 적을지 고르는 일, 곧 틀 짓기입니다.
어떤 수술을 받은 100명 중 98명이 한 달 뒤 살아 있었다고 하겠습니다. 이 사실은 "100명 중 98명이 살아남는다"로 적을 수도 있고, "100명 중 2명이 숨진다"로 적을 수도 있습니다. 두 문장은 같은 표를 가리키지만, 읽는 사람에게 남는 인상은 같지 않습니다.
형식이 고르는 것은 셋입니다. 첫째는 척도입니다. 상대적으로 적을지 절대적으로 적을지, 백분율로 적을지 사람 수로 적을지를 고릅니다. 둘째는 기간입니다. 10년 동안의 위험을 적을지 남은 평생의 위험을 적을지를 고릅니다. 셋째는 무엇을 셀지입니다.
셋째를 부르는 말이 따로 있습니다. 연구가 세기로 정한 일을 사건이라고 하고, 그 일이 실제로 일어난 사람의 비율을 사건율이라고 합니다. 같은 사람들을 두고도 심장과 혈관에 생긴 일을 모두 세느냐(심혈관 '사건'), 그로 인한 사망만 세느냐(심혈관 '사망')에 따라 사건율은 크게 달라집니다.
이 셋이 모두 형식이고, 셋 다 판단을 바꿉니다. 아래 두 절이 그 모습을 차례로 보여 줍니다.
전문가에게도 바뀝니다
형식에 따라 판단이 흔들리는 것은 숫자를 다루는 전문가도 마찬가지입니다. 치과의사도 같은 이득을 어떤 형식으로 받느냐에 따라 이해가 달라졌습니다 (브라질 리우데자네이루, 치과의사 101명 무작위 배정).
이 시험이 다룬 것은 항생제를 함께 쓰는 잇몸 치료이고, 그 이득은 여러 개의 치아를 잃는 일을 피하는 것입니다. 한쪽에는 이 이득을 사람 수로, 다른 쪽에는 상대위험감소로 제시하고 다섯 문항에 답하게 했습니다. 항생제를 썼을 때를 물은 문항에서는 사람 수로 본 쪽이 더 많이 맞혔습니다. 사람 수 군은 26명(50%), 상대위험감소 군은 14명(29%)이 맞혔습니다(p = 0.04). 괄호 속 p값은 두 군에 실제 차이가 없다고 가정했을 때 이만큼 벌어진 결과가 우연히 나올 확률이고, 작을수록 우연으로 보기 어렵다고 읽습니다.
나머지에서는 차이가 없었습니다. 항생제를 쓰지 않았을 때를 물은 문항은 17명(33%) 대 12명(25%)이었습니다(p = 0.39). 두 문항을 모두 맞힌 사람은 16명(31%) 대 12명(25%)이었습니다(p = 0.51).
저자들의 결론을 먼저 옮깁니다. 제시 형식과 무관하게 대부분의 치과의사가 치료의 이득을 정확히 이해하지 못했습니다. 사람 수로 제시했을 때 정확히 이해한 사람이 조금 더 많았을 뿐입니다 (PMID 39109767).
형식은 차이를 만들었지만, 그 차이로 문제가 풀리지는 않았습니다. 형식이 판단을 바꾸면서도 늘 이기지는 못한다는 이 글의 두 결론이 이 시험 하나에 함께 들어 있습니다.
숫자를 다루는 능력에서도 비슷한 그림이 나옵니다. 수리력은 확률과 비율 같은 숫자 정보를 이해하고 다루는 능력입니다. 한 기관에서 전신마취 수술을 앞둔 환자와 그 기관의 전문의에게 문항 다섯 개짜리 같은 설문을 보냈고, 환자 213명(42%)과 의사 268명(53%)이 답했습니다. 환자 점수의 중앙값(점수를 줄 세웠을 때 가운데 값)은 5점 만점에 4점이었습니다. 그런데 환자의 32%는 3점 이하였고, 환자들은 자기 점수를 실제보다 평균 0.5점 높게 짐작했습니다. 자기 수리력을 실제보다 높게 믿는 환자가 있다는 뜻입니다. 의사 점수는 더 높았고, 짐작과 실제가 어긋나지 않았습니다. 다만 저자들은 일부 의사도 수리력이 낮았다고, 그리고 낮은 수리력이 위험 감소를 이해하지 못하는 것과 연관됐다고 적습니다 (PMID 32304457).
시간과 사건을 바꾸면 인식이 따라 움직입니다
척도만이 아니라 기간과 세는 대상도 판단을 바꿉니다. 같은 가상 환자의 위험을 세 가지로 적어 보이자, 사람들이 느끼는 위험의 크기가 크게 달라졌습니다 (PMID 30419113).
세 가지는 10년 심혈관 사건 위험 15%, 10년 심혈관 사망 위험 4%, 평생 심혈관 사건 위험 50%입니다. 셋 다 같은 환자의 위험이고, 기간과 세는 대상만 다릅니다. 이 숫자를 본 사람은 미국 140개 진료기관 레지스트리에 참여한 2,708명(적격자의 76.9%)입니다.
위험을 "높음~매우 높음"으로 본 비율은 평생 위험을 봤을 때 70.1%였습니다. 10년 사건 위험을 봤을 때는 31.4%, 10년 사망 위험을 봤을 때는 25.7%였습니다(둘 다 P < .001). 약을 먹을 의향도 같은 순서였습니다(77.9% / 68.1% / 63.1%). 숫자만 보면 같은 환자가 위험해 보이기도 하고 덜 위험해 보이기도 한다는 뜻입니다.
참가자는 이 위험을 숫자만으로, 막대그래프로, 얼굴 그림문자로 보는 세 방식 중 하나에 무작위로 배정됐습니다. 그림문자를 본 사람들이 병을 가장 덜 심각하게 봤고, 치료를 고려할 의향도 가장 낮았습니다. 저자들의 결론은 형식·시간 지평·결과가 모두 환자 인식에 영향을 주므로, 위험 소통 도구를 설계할 때 함께 고려해야 한다는 것입니다 (PMID 30419113).

같은 사람, 같은 병, 같은 자료입니다. 바뀐 것은 얼마 동안을 재는가와 무엇을 세는가뿐이었습니다.
그런데 형식이 늘 이기지는 않습니다
여기까지 읽으면 형식만 잘 고르면 판단이 바로잡힐 것 같습니다. 그런데 형식을 바꿔도 판단이 거의 달라지지 않은 시험이 여럿 있습니다. 세 시험을 저자 결론부터 옮깁니다.
첫째는 골밀도 검사를 받는 환자 200명을 네 군으로 무작위 배정한 시험입니다. 네 군은 두 가지 선택을 조합해 만들었습니다. 하나는 골절 위험을 "일이 일어날 확률"로 적을지 "일어나지 않을 확률"로 적을지이고, 다른 하나는 치료 이득을 자연빈도(아래 절에서 다루는, 사람 수로 적는 방식)로 적을지 NNT로 적을지입니다. 저자들의 결론은 이렇습니다. 틀을 바꾼 것은 치료가 필요하다는 참가자의 생각에도, 자기 골절 위험을 보는 눈에도 거의 영향을 주지 않았습니다. 참가자들에게 골절 위험이 몇 %를 넘으면 예방 약물을 고려하겠는지 물었더니, 5년 위험 기준으로 답의 중앙값은 50~60%였습니다. 이 값은 설명을 들은 뒤에도 크게 달라지지 않았고, 이 결과들에서 무작위 배정군 사이의 차이는 없었습니다.
다만 같은 논문에 다른 일도 적혀 있습니다. 참가자가 처음 짐작한 5년 골절 위험은 위험 계산기의 추정치보다 높았습니다. 부위를 가리지 않은 골절은 2~3배, 고관절 골절은 10~20배 높게 짐작했습니다. 이 짐작은 설명을 들은 뒤 절반으로 줄었습니다(여전히 계산기 값보다는 높았습니다). 그리고 같은 초록이 곧바로 한정합니다. 위험과 치료 이득에 대한 정보를 받았어도 약을 먹겠다는 참가자의 의향은 크게 달라지지 않았습니다. 형식을 바꾼 것은 판단을 움직이지 못했고, 정보를 준 것이 움직인 것도 위험 추정치까지였습니다 (PMID 28188155).
둘째는 시각화, 곧 숫자 옆에 그림을 붙이는 방법입니다. 네덜란드 일반 인구 393명이 백분율과 자연빈도를 서로 바꾸는 기본 문제 네 개를 풀었습니다. 문제마다 아이콘 배열·원그래프·막대그래프·시각화 없음 중 하나가 무작위로 붙었고, 누가 무엇을 받았는지는 조사자도 몰랐습니다. 응답자의 60%가 네 문제를 모두 맞혔습니다. 시각화는 정답률과 연관되지 않았습니다(오즈비 1.08, 95% CI 0.69–1.69). 오즈비는 정답을 맞힐 가능성을 두 조건끼리 견준 값으로 차이가 없으면 1이고, 참값이 있을 법한 범위인 신뢰구간(CI)이 1을 걸쳐 있으니 그림이 정답률을 올렸다고 볼 수 없습니다. 세 종류의 그림이 모두 그랬고, 위험을 적은 형식도 위험의 크기도 정답률과 연관이 없었습니다. 대신 나이가 젊을수록, 교육 수준이 높을수록 점수가 높았습니다. 저자들이 붙인 단서도 함께 옮깁니다. 이 결과는 단일 절대위험을 글자 그대로 전달하는 좁은 목적에 한정됩니다. 시각화가 사용자 경험이나 위험 소통에 대한 인식, 그에 이어지는 환자 참여에 어떤 효과를 내는지는 아직 규명되지 않았습니다 (PMID 31901707).
셋째는 이해가 늘었는데도 선택이 바뀌지 않은 시험입니다. 미국 성인 600명이 이형성 모반이라는 피부의 점에 대한 의사결정 보조도구를 읽었습니다. 보조도구는 위험을 숫자로 적은 정량형과 말로 적은 정성형 중 하나가 무작위로 주어졌습니다(A/B 시험). 정량형을 읽은 쪽은 스스로 매긴 이해도(80 대 72, P = .008)와 결정 확신(P = .003)이 높았고, 흑색종 위험을 더 낮게 봤습니다. 그런데 점을 떼어 내겠다는 절제 의향은 달라지지 않았습니다(52% 대 53%, 오즈비 1.04, P = .818). 의향을 움직인 것은 진단명에 붙은 중증도 표기였습니다. 경도로 적었을 때 31%, 중등도 41%, 중증 72%였고(P < .001), 이 표기는 이해도에는 영향을 주지 않았습니다. 숫자를 이해했는지보다 진단명의 「경도」「중증」이 결정에 더 크게 작용했다는 뜻입니다.
저자들의 결론이 이 절 전체의 요약에 가깝습니다. 정량형이 이해를 높이는 것은 맞지만, 치료 의향을 주로 이끄는 것은 진단명의 중증도입니다. 그리고 이해도가 높은데도 참가자의 약 3분의 1이 전문가 권고와 다른 선택을 했습니다. 개인의 가치가 치료 선택을 이끕니다 (PMID 41893389).
세 시험은 사람이 숫자에 쉽게 속는다는 증거로 읽히기 쉽습니다. 실제로 보여 주는 것은 형식이 맡는 일의 범위입니다. 형식은 문장을 정확하게 만드는 일이지, 결정을 대신하는 일이 아닙니다. 정확한 문장을 읽고도 다르게 결정하는 것은 오류가 아니라 가치의 문제입니다.
논문을 떠난 뒤 — 스핀
지금까지는 숫자가 처음 적히는 자리, 곧 논문과 진료실의 문장을 봤습니다. 연구 결과는 그 뒤 보도자료와 기사로 옮겨 가며, 그 과정에서 한 번 더 모양이 바뀝니다. 이 사슬은 실제로 추적된 적이 있습니다.
여기서 새 말이 하나 필요합니다. 스핀은 결과를 실제보다 이롭게 보이도록 쓰는 보고 방식입니다. 숫자를 바꾸지 않는다는 점에서 거짓말과 다릅니다. 숫자는 그대로 두고, 독자의 눈길이 어디에 가게 할지만 고릅니다. 예를 들어 연구가 처음부터 주된 질문으로 정한 1차 결과가 잘 나오지 않았을 때, 잘 나온 부차적 결과를 결론으로 올립니다. 한정어를 떼기도 합니다. 의도적일 수도 있고 아닐 수도 있습니다.
스핀의 출발점은 흔히 논문 자신입니다. 보도자료로 소개된 무작위시험 70건을 따라가 보니, 스핀은 초록 결론 28건(40%)과 보도자료 33건(47%)에 있었습니다. 초록은 논문 첫머리의 요약이고, 보도자료는 대학이나 학술지가 언론에 내는 소개 글입니다. 여러 요인을 한꺼번에 따진 분석(다변량 분석)에서 보도자료의 스핀과 연관된 요인은 초록 결론의 스핀 하나뿐이었습니다. 초록 결론에 스핀이 있으면 보도자료에도 스핀이 있을 가능성이 5.6배였습니다(상대위험, 95% CI 2.8–11.1). 보도자료만 읽으면 결과가 과대평가되는 경우가 19건(27%)이었습니다. 기사가 확인된 41건 중 21건(51%)에 스핀이 있었는데, 대체로 같은 종류였습니다. 기사만 읽으면 과대평가되는 경우는 10건(24%)이었습니다. 초록 결론에 있던 종류의 스핀이 보도자료와 기사에서도 대체로 그대로 보였다는 뜻입니다 (PMID 22984354; 2009년 12월~2010년 3월 한 보도자료 데이터베이스의 498건에서 두 군 평행설계 무작위시험만 추린 코호트 연구).

보도자료의 과장이 기사로 옮겨 가는 모습은 훨씬 큰 자료에서도 나타납니다. 2011년 영국 주요 대학 20곳의 생의학·보건 보도자료 462건과 관련 기사 668건을 원논문과 대조한 결과입니다 (PMID 25498121). 이 연구는 이미 나온 글을 모아 내용을 맞대 본 후향적 내용분석입니다. 그래서 두 진술의 강도가 함께 움직이는지는 보여 주지만, 어느 쪽이 원인인지는 세우지 않습니다.
과장은 세 종류였습니다. 보도자료의 40%(95% CI 33–46)는 원논문을 넘어선 행동 권고를 담고 있었습니다. 33%는 함께 움직인다는 상관자료에서 끌어낸 인과 진술을, 36%는 동물연구 결과를 사람에게 옮긴 추론을 담았습니다. 보도자료에 과장이 있으면 기사에도 같은 과장이 있을 때가 훨씬 많았습니다. 과장이 있을 때 기사에 같은 과장이 있는 비율은 종류별로 58%·81%·86%였고, 없을 때는 17%·18%·10%였습니다(오즈비 6.5, 20, 56).
그런데 과장된 보도자료가 기사를 더 많이 끌어냈다는 증거는 거의 없었습니다. 저자들은 결론에서 고칠 지점을 가리킵니다. 학술 보도자료의 정확도를 높이는 것이 오도하는 건강 기사를 줄이는 핵심 기회일 수 있습니다 (PMID 25498121).
이 결과는 그 뒤 두 번 더 검증됐습니다. 한 번은 같은 연관이 다시 나오는지를 본 재현이고, 한 번은 상황이 나아졌는지를 본 추적입니다.
재현은 2014·2015년 영국 대학 자료로 했습니다. 행동 권고 과장에 대한 연관은 재현되지 않았고, 인과 진술과 사람으로의 추론에 대한 연관은 재현됐습니다. 저자들의 전체 정리는 이렇습니다. 기사 진술의 강도는 대체로 보도자료 진술의 강도와 함께 가며, 과장한 진술이 기사를 유의하게 더 많이 얻는다는 근거는 없습니다 (PMID 31728413).
추적에서는 개선이 보였습니다. 상관자료를 두고 인과를 과장한 보도자료의 비율은 2014년 28%(95% CI 16–45)에서 2015년 13%(6–25)로 낮아졌습니다. 다만 기사 쪽 감소는 유의하지 않았고, 보도자료와 기사의 연관은 여전히 강했습니다. 저자들은 이것이 상관 증거라서 다른 요인이나 자연적 변동 때문일 수 있다고 명시합니다 (PMID 32500096).
사슬의 끝, 곧 기사를 읽은 사람의 판단도 스핀에 따라 움직였습니다 (PMID 31159786). 환자·보호자 온라인 커뮤니티에서 모집한 900명이 같은 연구를 다룬 기사를 읽었습니다. 한쪽은 스핀이 있는 원문을, 다른 쪽은 스핀을 걷어 내 다시 쓴 판본을 무작위로 받았습니다. 그리고 "이 치료가 환자에게 이로울 확률"을 0에서 10까지로 매겼습니다. 시험은 세 번이었고, 각각 다른 연구 단계의 기사를 다뤘습니다. 세 번 모두 스핀이 있는 판본을 읽은 쪽 점수가 높았습니다. 사람에게 쓰기 전 단계인 전임상 연구는 7.5 대 5.8, 초기 임상 비무작위 연구는 7.6 대 5.8, 후기 무작위시험은 7.2 대 4.9였습니다(평균차 1.7·1.8·2.3, 모두 p < 0.001).
이 사슬에서 언론을 탓하기 쉽지만, 이 문헌이 반복해 가리킨 출발점은 논문 자신의 초록 결론입니다.
개선책은 무엇이고, 얼마나 듣나
여기까지는 문제를 봤습니다. 이 분야 연구는 개선책을 내놓고, 그 효과를 실제로 재는 데까지 갔습니다. 셋을 차례로 봅니다.
① 기저위험을 함께 적기
치료 효과에 기저위험, 곧 아무것도 하지 않았을 때의 원래 비율을 함께 적으면 이해가 크게 올랐습니다 (PMID 30005747). 다발경화증 환자들에게 가상의 임상시험 결과를 보여 주고 이해도를 여러 번 잰 반복측정 연구입니다. 이득과 위해는 절대 표현, 상대 표현, NNT와 NNH로 제시했습니다. NNH는 NNT를 위해 쪽으로 뒤집은 값으로, 한 명이 해를 입기까지 몇 명을 치료하게 되는지 센 것입니다. 그리고 방법마다 기저 정보를 붙인 판과 붙이지 않은 판을 함께 돌렸습니다.
방법끼리 견주면 이해도 점수는 절대 표현(3.99)이 상대 표현(2.93)이나 NNT·NNH(2.89)보다 높았습니다(둘 다 P < 0.001). 그런데 이 실험 안에서 차이가 가장 크게 벌어진 것은 기저 정보의 유무였습니다. 모든 방법에 기저 정보를 붙였을 때 점수는 5.04, 붙이지 않았을 때는 1.50이었습니다(P < 0.001). 이해도는 치료 결정을 두고 갈등하는 정도와는 연관되지 않았고, 수리력·지능·인지 기능은 이해도와 유의하게 연관됐습니다. 저자들의 권고는 위험과 이득을 절대 표현으로, 기저 정보와 함께 전달하는 것입니다. 수리력·지능·인지 기능이 낮은 환자는 따로 지원하라고도 권합니다 (PMID 30005747).
⚠️ 이 숫자는 한 실험 안에서 두 조건을 견준 결과입니다. 여러 개선책을 가로질러 크기를 매긴 것이 아니므로, "기저위험을 함께 적는 것이 모든 개선책 가운데 가장 효과가 크다"는 뜻으로 넓혀 읽을 수 없습니다.
약의 부작용을 알릴 때도 같은 방향이 나왔습니다 (PMID 16242904). 여성 268명에게 어떤 약의 부작용 위험이 올라간다는 가상 시나리오를 줬습니다. 위험 증가는 상대위험·절대위험·NNH 중 하나로 제시했고, 기저위험 정보를 넣은 판과 뺀 판을 나눴습니다. 기저 정보를 주면 위험 추정이 유의하게 정확해지고 만족도가 올라갔습니다. 다만 저자들은 곧바로 단서를 붙입니다. 그렇게 해도 추정치는 여전히 실제 위험보다 상당히 높았습니다. 기저 정보가 있을 때는 형식들 사이에 차이가 없었고, 없을 때는 절대위험 표현이 가장 정확한 수행을 이끌었습니다. 저자들은 결론에서 NNH 사용을 지지하는 결과는 없었다고 못 박습니다. 그리고 일반인에게 NNH나 NNT를 제시하기 전에 더 많은 연구가 필요하다고 적습니다.
기저위험을 어떤 형식으로 적느냐도 중요했습니다. 기저위험은 백분율보다 빈도로 줄 때 더 잘 이해됐습니다 (PMID 24803429). 일반인 1,234명이 참여한 실험 네 건에서, 심장질환 위험을 낮추거나 높이는 가상 시나리오와 함께 상대위험 변화를 보여 줬습니다. 기저위험은 백분율로 주거나 빈도로 줬습니다. 빈도로 주면 이득과 위해에 대한 이해가 촉진됐고, 백분율은 오히려 이해를 방해하는 경우가 많았습니다. 예를 들어 많은 참가자가 상대위험감소를 절대위험감소로 오해했습니다. 수리력이 높은 사람이 대체로 더 잘했지만, 모든 참가자가 빈도 형식에서 이득을 봤습니다. 저자들은 가상 시나리오와 비대표 표본이라는 한계를 밝힙니다. 그리고 결론에 정직한 단서를 붙입니다. 전체적으로, 치료의 이득과 위해를 상대위험 변화 형태로 전달하는 것은 기저위험을 명시적으로 함께 줘도 여전히 문제로 남습니다 (PMID 24803429).
② 자연빈도 — 근거가 두꺼운 영역과 얇은 영역
자연빈도는 위험을 "1,000명 중 8명"처럼 사람 수로 적는 방식입니다. 1,000명을 세어 나가듯 적어서, 몇 명 중 몇 명인지가 문장 안에 남습니다. 주요 기관들이 검사 결과를 이 형식으로 제시하도록 권장해 왔습니다 (PMID 27034447).
자연빈도의 근거는 한 영역에 몰려 있습니다. 이 절이 인용하는 자연빈도 실험은 하나도 빠짐없이 치료 이득의 크기가 아니라 검사 결과의 해석에서 나왔습니다. 실험들이 풀게 한 문제는 양성예측도를 구하는 것이었습니다. 양성예측도는 검사가 양성으로 나온 사람이 실제로 병이 있을 확률입니다.
자연빈도와 견주는 상대는 조건부확률 표기입니다. 조건부확률은 "병이 있을 때 양성이 나올 확률"처럼 어떤 조건 아래에서 일이 일어날 확률이고, 같은 사실을 "0.8%"처럼 백분율로 적습니다. 이 영역의 근거는 두껍습니다. 여러 연구의 결과를 모아 한꺼번에 계산하는 메타분석이 20년치 연구, 문헌 35편에서 226개의 수행 추정치를 통합했습니다. 이 분석은 정답률을 바꾸는 조건으로 수리력·전문성, 유인과 채점 기준, 문제를 적는 방식을 검토했습니다. 가장 강한 축에 드는 조건은 짧은 메뉴 형식과 시각 보조였습니다. 짧은 메뉴 형식은 계산이 덜 필요하도록 겹치는 경우를 함께 보여 주는 짧은 표기입니다. 이 둘은 조건부확률 형식과 자연빈도 형식 양쪽 모두의 수행을 개선했습니다 (PMID 29048176).
자연빈도는 고령자에게도 도움이 됐습니다 (PMID 19129155). 젊은 성인 115명과 노인 47명에게 두 가지 선별검사 정보를 줬습니다. 조건부확률로 제시했을 때 적어도 한 과제에 정확한 추정을 낸 비율은 젊은 성인 15%, 노인 18%였습니다. 자연빈도로 제시하자 이 비율이 55%와 58%가 됐습니다. 훈련 없이 나타난 차이입니다. 수리력 점수가 높은 참가자가 더 잘하기는 했습니다. 저자들의 결론은 자연빈도가 젊은 환자와 고령 환자를, 수리력이 낮은 사람을 포함해 돕는다는 것입니다.
자연빈도는 훈련과 함께할 때 효과가 가장 컸습니다 (PMID 36747214). 의대생 577명을 훈련 전후로 잰 연구입니다. 조건부확률로 제시된 문항의 정답률은 훈련 전 34%였고, 같은 정보를 자연빈도로 제시하면 훈련 없이도 68%로 올랐습니다. 조건부확률을 자연빈도로 바꿔 베이즈 규칙(새 검사 결과를 보고 확률을 고쳐 계산하는 규칙)에 적용하는 법을 훈련한 뒤에는, 조건부확률 문항도 64%가 됐습니다. 훈련과 자연빈도 제시를 함께 하면 89%였습니다.
그러나 이 도구에는 반박이 붙었고, 논쟁은 아직 살아 있습니다.
한 논문은 자연빈도 제시가 보건서비스 이용자와 환자 표본의 많아야 5분의 1에게만 이득이 되며, 상당한 이득을 보고한 연구는 단 한 편뿐이었다고 지적했습니다. 이 논문은 그 한 편을 온라인 응답자로 재현했고, 앞서 보고된 이득이 채점 방식이 만든 겉보기 효과, 곧 인공물이라고 봤습니다. 또 자연빈도가 규범적으로 옳은 평가, 곧 확률 계산상 맞는 판단과 상충하는 평가를 유발할 수 있다고 적었습니다. 그런 평가는 역설적으로, 한 사건의 확률을 그대로 적은 단일사건 확률에서 더 적었습니다. 결론은 홍보에 신중하라는 것이었습니다 (PMID 27034447).
반박에 대한 반박도 나왔습니다 (PMID 29448883). 근거는 세 가지 분석입니다. 첫째, 문제가 된 '50-분할' 채점법은 검사의 적중률만 보고 답하는 것 같은 알려진 오류를 이해로 오분류합니다. 둘째, 여러 참가자 집단이 푼 추가 문제 21개 중 19개에서 그 채점 기준은 원저자들의 결과를 뒷받침하지 못합니다. 셋째, 평균편차 채점법을 쓰면 자연빈도 쪽 추정치가 정답에 더 가깝습니다.
자연빈도가 모든 상황에서 최선인 것도 아닙니다 (PMID 40205446). 비교 상대는 오즈·우도비라는 표기로, 검사 결과가 확률을 몇 배로 바꾸는지를 곱셈으로 적습니다. 의대생 167명과 심리학과 학생 162명이 참여한 사전등록 무작위 교차 시험에서, 검사 하나의 양성예측도를 맞힌 비율은 자연빈도 36.2%로 오즈·우도비 21.6%보다 높았습니다(오즈비 2.41). 그런데 연속된 두 검사의 양성예측도에서는 순서가 뒤집혀, 오즈·우도비 10.6%가 자연빈도 4.9%보다 높았습니다(오즈비 2.73). 참가자가 스스로 매긴 이해도는 자연빈도 쪽이 훨씬 높았습니다. 저자들은 어느 하나를 버리지 말고, 자연빈도와 함께 오즈·우도비를 가르치자고 제안합니다.
논쟁을 정리하면 이렇습니다. 논쟁의 어느 쪽도 "형식만 바꾸면 이해가 따라온다"고 말하지 않습니다. 옹호하는 쪽조차 훈련과 결합했을 때 수행이 가장 좋았다고 보고합니다 (PMID 36747214). 두 이론 진영을 함께 검토한 메타분석은 시각 보조 같은 다른 요소가 두 형식 모두를 끌어올린다고 적습니다 (PMID 29048176). 그리고 이 근거가 검사 결과 해석에서 나왔다는 사실 자체가 한계입니다. 치료 이득의 크기를 자연빈도로 적으면 얼마나 나아지는가는 이 절의 실험들이 답한 질문이 아닙니다.
③ 두 형식을 함께 적기
절대위험을 백분율과 자연빈도로 동시에 적자는 제안도 있습니다. 주요 비뇨기암 수술 뒤 사망률을 두 형식으로 정리한 보고가 그 예입니다 (PMID 42134078). 전 술식에 걸친 30일 사망률은 0.02~2.70%, 90일 사망률은 0.07~5.57%였고, 이를 자연빈도로 옮기면 5,577명당 1명에서 37명당 1명 사이입니다. 이 수치들은 여러 코호트를 모은 서술적 벤치마크이지 개별 환자의 위험이 아닙니다. 이 사례에서 볼 것은 숫자보다 표기 형식입니다. 저자들의 결론은 두 형식이 수학적으로 동일하지만 서로를 보완하며, 국제 벤치마크와 함께 둘 다 보고하는 것이 위험 소통을 도울 수 있다는 것입니다. 한계로는 모은 자료 사이에 남은 차이(잔여 이질성)와 데이터셋 중복 가능성을 명시합니다.
검사 해석 밖에서도 빈도 표기를 지지하는 진술은 있습니다 (PMID 21931068). 암 검진·예방·치료 결정을 돕는 방법 열 가지를 정리한 논평입니다. 저자들이 실증적으로 이해나 의사결정을 개선한 것으로 확인됐다고 꼽은 방법에는 상대위험 대신 절대위험을 빈도로 제시하기, 치료가 기존 기저 수준에서 위험을 어떻게 바꾸는지 분명히 하는 형식, 쉬운 말이 들어 있습니다. 저자들이 그다음에 의료진에게 권한 것에는 쉬운 말과 그림문자, 상대위험 대신 절대위험이 들어 있습니다. 다만 이것은 논평이라 새 자료를 싣지 않습니다.
이 분야 전체를 놓고 보면, 어느 한 방식이 낫다는 합의는 제한적입니다. 위험 소통을 검토한 한 종설의 결론입니다. 같은 종설은 의사와 환자 모두 상대위험감소보다 NNT를 파악하기 어려워한다고 적고, 정량적·정성적 방식이 여럿 있다고 정리합니다 (PMID 15962835).
"논문만 정확하면 된다"는 왜 틀렸나
논문이 정확하기만 하면 나머지는 남의 일이라고 생각하기 쉽습니다. 이 글이 다루는 마지막 오해입니다.
결과가 단순해지고 부풀려지는 일은 논문 밖에서 더 많이 일어나지만, 그 출발점은 흔히 논문 자신의 초록 결론입니다. 보도자료 스핀의 유일한 연관 요인은 초록 결론의 스핀이었습니다 (PMID 22984354). 보도자료의 과장은 기사의 과장과 강하게 연관됐습니다 (PMID 25498121). 그렇게 부풀려진 기사는 환자·보호자가 치료의 이득을 더 높게 보게 만들었습니다 (PMID 31159786). 다만 이 연관은 부분적으로만 재현됐고 (PMID 31728413), 문제가 널리 알려진 뒤 보도자료의 인과 과장은 줄었습니다 (PMID 32500096).
남는 규칙
초록이나 기사에서 위험 숫자를 만나면 물어볼 것은 셋입니다. 프레이밍 절에서 본, 형식이 고르는 세 가지 그대로입니다. 첫째는 어떤 척도로 적혀 있는가입니다. 상대인지 절대인지, 백분율인지 사람 수인지를 봅니다. 둘째는 얼마 동안을 잰 숫자인가입니다. 셋째는 무엇을 센 숫자인가입니다. '사건'을 셌는지 '사망'을 셌는지를 봅니다. 하나만 바뀌어도 같은 자료가 다르게 읽힙니다.
이 글이 남기려는 문장은 하나입니다. 형식은 문장을 정확하게 만드는 일이지, 결정을 대신하는 일이 아닙니다. 형식을 고쳐도 이해가 저절로 따라오지 않는다는 것을 여러 시험이 보였고, 이해가 늘어도 선택은 각자의 가치를 따랐습니다. 그렇다고 형식이 상관없다는 뜻은 아닙니다. 같은 결과를 다르게 설명한 것만으로, 약을 받아 간 사람의 비율이 5.4%와 25.0%로 갈렸습니다.
근거 논문
형식이 판단을 바꾼다
- PMID 24686884 (2014) "ARR vs POL" — 군집무작위, 덴마크 일반의 34명·환자 240명. 조제율 5.4% 대 25.0%, 확신·만족도는 차이 없음.
- PMID 39109767 (2024) "Dentists' understanding" — 무작위, 치과의사 101명(5문항 중 2문항+합성만 보고). 항생제 사용 문항 50% 대 29%. 결론=형식과 무관하게 대부분이 이해 못 함.
- PMID 32304457 (2020) "Health Numeracy & RR" — 단면 설문, 환자 213·의사 268. 환자 32%가 3점 이하, 일부 의사도 낮음. 결론=낮은 수리력↔위험 감소 몰이해.
- PMID 30419113 (2018) "CV Risk Communication" — 레지스트리 2,708명. 인식 평생 70.1%·10년 사건 31.4%·10년 사망 25.7%. 결론=형식·시간·결과를 함께 고려.
그리고 바꾸지 못한다
- PMID 28188155 (2017) "Framing of fracture risk" — 무작위 200명 4군. 결론=틀을 바꾼 것은 거의 영향 없고 배정군 간 차이 없음. 정보를 받아도 복용 의향은 크게 달라지지 않았다.
- PMID 31901707 (2020) "Do visualizations help?" — 무작위·조사자 눈가림 393명. 시각화 OR 1.08. 단서=단일 절대위험 전달에 한정.
- PMID 41893389 (2026) "Quantitative vs qualitative" — 무작위 A/B 600명. 이해도↑·절제 의향 불변(52% 대 53%), 중증도가 의향을 이끔. 결론=개인의 가치가 선택을 이끈다.
논문 → 보도자료 → 기사
- PMID 22984354 (2012) "Misrepresentation of RCTs" — 코호트 RCT 70건. 초록 결론 스핀 40%·보도자료 47%. 다변량에서 유일한 연관 요인은 초록 결론 스핀(RR 5.6).
- PMID 25498121 (2014) "Exaggeration in news & PR" — 후향적 내용분석, 보도자료 462건·기사 668건, OR 6.5/20/56. 결론=보도자료 정확도가 핵심 기회.
- PMID 31728413 (2019) "…replication" — 재현 코호트(2014·2015). 행동 권고는 재현 실패, 인과 진술·사람 추론은 재현.
- PMID 32500096 (2020) "Causal overstatements reduced" — 전후 비교. 인과 과장 28%→13%, 기사 쪽은 유의하지 않음. 상관 증거임을 명시.
- PMID 31159786 (2019) "Impact of 'spin' (3 RCTs)" — 무작위 3건 900명. 스핀 유무 7.5/5.8·7.6/5.8·7.2/4.9.
개선책과 그 효과
- PMID 30005747 (2018) "Communicating trial data (MS)" — 반복측정. 절대 3.99·상대 2.93·NNT/NNH 2.89, 기저 있음 5.04 대 없음 1.50(한 실험 안의 대비). 결론=절대 표현+기저 정보.
- PMID 16242904 (2006) "Medicine side effects" — 2요인 실험 268명. 기저 정보가 정확도·만족도 개선(추정치는 여전히 높음). 결론=NNH 지지 없음.
- PMID 24803429 (2014) "RR changes with baseline" — 실험 4건 1,234명. 빈도는 촉진·백분율은 방해. 결론=상대위험 변화는 기저위험을 줘도 문제.
- PMID 29048176 (2017) "Meta-analysis: NF" — 메타분석 35편·226 추정치, 두 이론 진영을 함께 검토. 짧은 메뉴 형식·시각 보조가 두 형식 모두 개선.
- PMID 19129155 (2009) "NF help older adults" — 실험, 젊은 성인 115명·노인 47명. 조건부확률 15%/18%→자연빈도 55%/58%, 훈련 없이. 결론=수리력 낮은 사람도 포함해 돕는다.
- PMID 36747214 (2023) "Boosting insight/agency" — 사전·사후 의대생 577명. 34%→68%, 훈련 후 64%, 훈련+자연빈도 89%.
- PMID 27034447 (2016) "NF Do Not Foster…" — 재현 실험. 이득은 보건서비스 이용자·환자 표본의 많아야 5분의 1, 선행 이득은 채점 인공물. 결론=홍보에 신중하라.(주요 기관 권장 진술의 출처)
- PMID 29448883 (2018) "NF Do Foster…: Comment" — 논평·재분석. 50-분할 채점이 알려진 오류를 이해로 오분류, 21개 중 19개에서 원 결과 미지지.
- PMID 40205446 (2025) "LRs vs NF" — 사전등록 교차 329명. 단일 검사 36.2% 대 21.6%, 연속 두 검사는 오즈/우도비 10.6% 대 4.9%. 결론=둘 다.
- PMID 42134078 (2026) "Postop mortality: % and 1-in-N" — 서술적 벤치마크 리뷰. 30일 0.02~2.70%·90일 0.07~5.57% = 5,577명당 1명~37명당 1명. 결론=수학적 동일·상호보완.
- PMID 21931068 (2011) "Ten steps to risk communication" — 논평. 실증 확인 열 가지에 절대위험을 빈도로 제시하기·기저 수준의 변화를 분명히 하는 형식·쉬운 말 포함. 그림문자는 그 뒤 저자 권고 쪽.
- PMID 15962835 (2005) "Translating evidence into RC" — 종설. 의사와 환자 모두 상대위험감소보다 NNT를 파악하기 어려워합니다. 결론=한 방식의 우위에 합의는 제한적.