
Paperis 아티클
메타분석은 평균을 내지 않는다 — 숲그림의 마름모가 만들어지는 법
메타분석은 여러 연구의 결과를 단순히 평균 내는 장치가 아니라 각 연구에 무게를 배분하는 장치입니다. 마름모의 위치는 그 무게가 어디에 몰렸는지가 정하고, 무게를 나누는 규칙은 고르는 사람이 정합니다.
메타분석은 평균을 내지 않는다 — 숲그림의 마름모가 만들어지는 법
인지장애가 있는 고령자에게 운동이 인지기능에 도움이 되는가. 이 질문 하나를 다룬 메타분석 40편을 한자리에 모아 보면, 근거가 보기보다 얇습니다. 메타분석은 같은 질문을 다룬 여러 연구의 결과를 모아 하나로 합친 분석입니다. 40편이 근거로 든 무작위시험을 모두 세면 728건입니다. 무작위시험은 참가자를 제비뽑기로 두 군에 나눈 시험입니다. 그런데 같은 시험을 한 번씩만 세면 276편(37.9%)뿐입니다. 153편은 메타분석 한 편에만 들어갔고, 123편은 2~19편의 서로 다른 메타분석에 거듭 들어갔습니다. 결국 728건 중 452건(62.1%)이 중복, 곧 둘 이상의 메타분석에 겹쳐 들어간 시험이었습니다.
저자들은 결론에서 이렇게 적습니다. 같은 시험을 여러 메타분석이 되쓰면 견고함의 착시, 곧 근거가 실제보다 튼튼해 보이는 착시가 생기고, 실제로는 근거의 강도와 다양성이 더 제한적일 수 있다 (PMID 40253011). 메타분석이 여러 편 있다고 해서 독립된 근거가 그만큼 있는 것은 아니라는 뜻입니다.
다른 질문에서도 비슷한 모습이 보입니다. 어깨 쪽 위팔뼈 끝이 부러지는 근위상완골 골절을 수술로 치료할지 말지를 다룬 체계적 문헌고찰 21편을 모아 보면, 정작 이 주제로 발표된 무작위시험은 8편뿐입니다. 체계적 문헌고찰은 연구를 정해진 절차로 빠짐없이 모아 검토한 글로, 아래에서 더 자세히 풉니다. 21편 중 18편은 방법론적 질 평가에서 최하 등급이었고, 나머지 1편은 최상 등급이었습니다. 결론은 기능·삶의 질·해로움이라는 세 결과 영역 전부에서 엇갈렸습니다. 포함 기준을 비슷하게 적어 놓은 고찰들끼리도 그랬습니다. 다만 저자들이 결론에 적은 것은 질이 워낙 고르게 낮아 질과 결론 사이의 연관 자체를 평가할 수 없었다는 것입니다 (PMID 34718123). 그래서 결론이 엇갈린 까닭을 질의 차이로 설명할 수도 없었습니다.
메타분석 자체도 매우 빠르게 늘었습니다. 1991년부터 2014년까지 해마다 발표되는 양은 체계적 문헌고찰이 2,728%, 메타분석이 2,635% 늘었습니다. 같은 기간 PubMed에 실린 논문 전체는 153% 늘었습니다. 그래서 이 조사는, 지금은 해마다 새로 나오는 무작위시험보다 그것들을 모은 체계적 문헌고찰이 아마도 더 많이 나올 것이라고 적습니다. 같은 주제의 메타분석이 때로는 20편을 넘기도 합니다. 저자의 최종 판정에는 한정어가 붙어 있습니다. 만들어지는 체계적 문헌고찰과 메타분석의 대다수가 불필요하거나, 오도하거나, 이해관계에 얽혀 있을 가능성이 있다는 것입니다 (PMID 27620683).
그래서 "메타분석에서 확인됐다"는 한 줄을 그대로 삼키지 않는 읽기가 필요합니다. 이 글은 메타분석이 내놓는 그림 한 장, 곧 숲그림을 읽는 법을 다룹니다. 메타분석을 직접 하는 법은 다루지 않습니다.
새로 배울 말은 일곱 개이고, 각 말은 처음 나오는 자리에서 풉니다. 신뢰구간은 「한 번 센 숫자는 얼마나 흔들리나 — 괄호 안 두 숫자, 신뢰구간」과 「신뢰구간은 오차범위가 아니다 — 괄호 안 두 숫자를 읽는 법」에서 이미 다뤘으니, 쓰이는 자리에서 한 문장으로만 다시 짚습니다. 아래에 나오는 치료·수술 이름은 전부 읽는 법을 보이기 위한 사례이고, 어떤 치료가 좋은지에 대한 판정이 아닙니다.
모으는 절차와 합치는 계산
메타분석은 같은 질문을 던진 연구가 여럿 있을 때, 그 결과들을 통계적으로 합쳐 하나의 요약값을 내는 방법입니다. 이름은 어렵게 들리지만 하는 일은 이것입니다. 목적은 개별 연구 하나보다 모집단의 참값을 더 잘 대표할 수 있는 값을 얻는 것입니다. 모집단의 참값은 연구가 알고 싶어 하는 사람들 전체에서의 진짜 값을 말합니다. 평균·비율·위험의 비·오즈비 등 여러 종류의 통계량을 이렇게 합칠 수 있습니다 (PMID 33027562).
그런데 합치기 전에 정할 일이 있습니다. 세상에 나온 연구 가운데 어느 것을 모을지입니다. 체계적 문헌고찰은 합칠 연구를 정해진 절차로 빠짐없이 모으는 작업입니다. 검색어와 포함·제외 기준을 미리 적어 두고, 여러 데이터베이스를 정해진 절차로 뒤집니다. 그리고 걸러진 연구가 설계 때문에 한쪽으로 치우쳤을 위험을 평가합니다.
두 말의 관계를 한 줄로 줄이면 이렇습니다. 체계적 문헌고찰은 모으는 절차이고, 메타분석은 모은 것을 합치는 계산입니다. 문헌고찰만 하고 합치지 않을 수도 있습니다. 메타분석의 단계도 이 순서를 따릅니다. 체계적 문헌 검색이 첫 단계이고, 그다음에 치우침 위험 평가·자료 추출·자료 합산이 옵니다 (PMID 39239131).
메타분석이 실제로 하는 일 — 연구마다 무게를 매긴다
연구 셋을 예로 들겠습니다. 참가자가 각각 40명, 400명, 4,000명이고, 세 연구가 낸 값은 −0.6, −0.2, −0.1입니다. (이 여섯 숫자는 설명을 위해 우리가 지어낸 것입니다. 이 예에서는 참가자가 많은 연구일수록 값이 덜 흔들린다고 하겠습니다.) 세 값의 산술평균은 −0.3입니다. 그런데 메타분석은 이 −0.3을 요약값으로 내지 않습니다.
각 연구가 낸 이 값을 효과크기라고 합니다. 효과크기는 그 연구가 찾은 효과가 얼마나 큰지를 한 숫자로 나타낸 것입니다.
메타분석은 각 효과크기에 무게를 매깁니다. 가중치는 요약값을 만들 때 그 연구의 값을 얼마나 반영할지를 정하는 숫자입니다. 가중치를 매기는 표준 방식은 역분산 가중입니다. 분산은 그 연구가 낸 값이 얼마나 흔들리는지, 곧 흔들림의 크기를 잰 숫자입니다. 역분산 가중은 이 흔들림의 크기를 뒤집은 값, 곧 역수를 무게로 씁니다. 그래서 흔들림이 작은 연구는 무거워지고, 흔들림이 큰 연구는 가벼워집니다. 뒤에 나올 두 모형은 가정이 서로 다르지만, 무게를 만드는 데는 둘 다 이 역분산 방식을 씁니다 (PMID 34550583).
그래서 4,000명짜리 연구는 40명짜리보다 훨씬 무겁고, 요약값은 −0.3이 아니라 −0.1 쪽으로 크게 끌려갑니다. 메타분석의 결론이 무엇이 될지는 이 무게 배분이 정합니다. 어느 연구를 넣고 뺄지는 재료를 정하고, 무게 배분은 그 재료로 나올 결과를 정합니다.

숲그림 — 무게를 눈으로 보는 그림
숲그림(forest plot)은 각 연구의 효과크기와 무게, 그리고 합친 요약값을 한 장에 그린 그림입니다. 메타분석의 결과는 이 그림으로 제시됩니다 (PMID 33027562).
그림의 생김새는 이렇습니다. 연구가 세로로 한 줄씩 쌓입니다. 줄마다 네모난 상자가 하나 찍히고, 상자 좌우로 수염처럼 가로선이 뻗습니다. 상자의 가로 위치는 그 연구의 효과크기입니다. 관례상 상자의 크기는 그 연구에 배정된 무게입니다. 수염의 길이는 신뢰구간입니다. 신뢰구간은 논문 본문에 괄호 안 두 숫자로 적히는 범위로, 이 데이터와 양립하는 값들의 범위입니다. 수염이 짧을수록 그 연구의 값이 정밀하다는 뜻입니다. 세로로 그어진 한 줄은 "차이 없음"의 자리입니다. 맨 아래에는 모든 줄을 합친 요약값이 마름모로 찍히고, 마름모의 좌우 폭이 요약값의 신뢰구간입니다.

이 그림을 처음 만날 때 가장 쓸모 있는 습관은 줄의 개수보다 상자의 크기를 보는 것입니다. 줄이 열두 개라고 근거가 열둘인 것은 아닙니다. 상자 하나가 나머지 열한 개를 합친 것보다 크다면, 무게의 절반 넘게를 그 한 연구가 가져간 것입니다. 그러면 마름모는 그 연구의 값 쪽으로 크게 끌려갑니다.
연구 하나의 결과도 숲그림으로 그린다
숲그림은 처음에는 메타분석 결과를 보여 주는 데 쓰였지만, 지금은 개별 연구 하나의 결과를 보여 주는 데도 씁니다. 신뢰구간(대개 95%)을 계산할 수만 있으면 질적 변수든 양적 변수든 그릴 수 있습니다. 변수 하나짜리 분석뿐 아니라 여러 변수를 함께 넣은 분석의 결과도 이 그림으로 그립니다. 숲그림은 최근 문헌에서 가장 널리 쓰이는 그래프 중 하나이고, 그 인기는 이렇게 쓰임이 넓은 것과 관련이 있습니다 (PMID 41774848). 여러 요인의 기여를 함께 추정하는 통계 모형의 결과를 표 대신 이 그림으로 그리자는 제안도 있습니다. 표는 길어지면 읽기 번거롭고 해석하기 어렵습니다. 그래서 모형 여럿을 한 그림에 늘어놓는 시각화 셋이 제안됐습니다 (PMID 38306346).
읽는 사람에게는 이것이 함정입니다. 줄과 수염이 늘어선 그림을 보고 "여러 연구를 합친 것"이라고 짐작하면 틀릴 수 있습니다. 구별하는 방법은 둘입니다. 맨 아래에 마름모가 있는지 봅니다. 그리고 각 줄의 라벨이 연구 이름인지 변수 이름인지 봅니다.
연구가 많아지면 이 그림은 무너진다
생태학·진화생물학에서는 메타분석 하나에 효과크기가 100개를 넘는 일이 흔합니다. 줄이 그렇게 많으면 고전적 숲그림은 쓸모가 크게 줄어듭니다. 실제로 이 분야 메타분석 102편 가운데 고전적 숲그림을 쓴 것은 11%뿐이었습니다. 대부분은 하위군이나 범주별로 추정값을 하나씩 찍은 '숲그림 비슷한 그림'을 썼습니다. 저자들이 대안으로 제안한 그림은 개별 효과크기를 정밀도에 비례하는 크기로 함께 찍습니다. 숲그림에서 상자 크기가 무게를 나타내는 것과 같은 발상입니다. 이 그림에는 구간이 하나 더 붙는데, 그 구간이 무엇에 답하는지는 「I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법」에서 다룹니다 (PMID 32445243).
같은 그림을 누가 읽을 수 있는가
통계 그림은 쓰이는 곳이 넓은 만큼, 누가 읽느냐도 문제가 됩니다. 같은 그림이 누구에게나 같은 것을 말해 주지는 않습니다. 2013년 영국은 일반외과 의사들의 위험보정 성적을 처음 공개했습니다. 위험보정 성적은 환자마다 다른 위험도를 감안해 맞춘 수술 결과입니다. 그때 쓰인 형식의 그림을 40명(일반인·의대생·비외과 의사·외과 의사 각 10명)에게 보여 주고 5분을 준 실험이 있습니다. 비외과 의사와 외과 의사 사이에는 차이가 없었습니다. 일반인은 외과 의사·비외과 의사보다 그 그림을 유의하게 더 어렵다고 답했습니다. 저자들의 결론은 일반인이 이해하려면 다른 표현 방식이 필요할 수 있다는 것입니다 (PMID 25600357). 외과 의사든 아니든 의사들은 비슷하게 읽었고, 일반인에게는 같은 그림이 더 어려웠다는 뜻입니다. 그 그림의 이름은 깔때기 그림입니다. 메타분석에서 깔때기 그림이 무엇에 답하는 도구인지는 「같은 시험, 다른 결론 — 출판편향과 "무엇을 합쳤는가"」에서 다루고, 이 글에서는 가르치지 않습니다.
고정효과와 랜덤효과 — 무게를 나누는 두 규칙
같은 연구 묶음과 같은 자료로도, 두 사람이 서로 다른 요약값을 낼 수 있습니다. 무게를 나누는 규칙을 다르게 잡았기 때문입니다. 논문에서 압도적으로 자주 만나는 규칙은 둘이고, 둘은 계산보다 먼저 무엇을 가정하느냐에서 갈라집니다.
고정효과 모형은 합치는 연구들이 모두 같은 참값 하나를 재고 있다고 가정하는 방식입니다. 이 가정이 맞다면, 관측된 효과크기들이 서로 다른 이유는 오직 표본을 뽑는 과정의 우연뿐입니다 (PMID 34550583). 이 가정은 합치려는 연구들이 설계·방법·표본에서 대체로 비슷할 때 그럴듯합니다. 그럴 때는 각 연구의 값을 하나의 참값 주위에서 흔들린 값으로 볼 수 있습니다 (PMID 41180834).
랜덤효과 모형은 연구마다 참값이 다를 수 있다고 가정하는 방식입니다. 이 모형은 그 여러 참값이 이루는 분포의 평균을 추정합니다. 이 가정에서는 관측된 값들의 차이가 두 군데에서 옵니다. 하나는 표본을 뽑는 과정의 우연이고, 다른 하나는 연구들 사이의 진짜 차이입니다 (PMID 34550583). 설계·방법·표본이 의미 있게 달라 참값이 여러 개라고 봐야 할 때 쓰는 모형입니다 (PMID 41180834). 연구들 사이의 진짜 차이가 왜 생기고 어떻게 재는지는 「I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법」에서 다룹니다. 이 글에 필요한 것은 그 차이가 무게 배분을 바꾼다는 사실 하나입니다.
랜덤효과 모형에서는 무게가 더 고르게 퍼집니다. 연구들 사이의 차이의 크기가 모든 연구에 공통으로 더해지기 때문입니다. 그 결과 작은 연구는 상대적으로 더 큰 무게를 받고, 큰 연구는 덜 받습니다. 요약값의 신뢰구간도 고정효과일 때보다 더 넓어집니다. 거꾸로, 연구들 사이에 실제 차이가 있는데 고정효과로 계산하면 지나치게 좁은 구간이 나올 수 있습니다 (PMID 34550583).
두 모형은 서로 반대되는 결과를 낼 수도 있습니다. 비슷한 값이 나오더라도 요약값의 뜻은 서로 다르게 읽어야 합니다 (PMID 24692250). 고정효과의 요약값은 참값 하나에 대한 추정이고, 랜덤효과의 요약값은 여러 참값이 이루는 분포의 평균에 대한 추정이기 때문입니다. 같은 논문의 저자들은 랜덤효과에서는 예측구간을 함께 쓰라고도 권합니다. 예측구간이 무엇에 답하는지는 「I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법」에서 다룹니다. 그리고 두 모형이 전부는 아닙니다. '있음/없음'으로 기록되는 자료에 맞춘 다른 고정효과 모형들이 있고, 랜덤효과 모형에도 확장형이 있으며, 둘 다 베이즈 방식으로 수행할 수 있습니다 (PMID 34550583).
실제로는 어떻게 고르고 있나
어느 모형을 쓸지는 결과를 보기 전에, 개념적 근거로 정해야 합니다. 분석 결과를 눈으로 훑어본 뒤에 정하는 것이 아닙니다 (PMID 41180834).
구강보건 분야의 실태를 보면 이 원칙이 늘 지켜지지는 않습니다. 대상은 2021~2023년 구강보건 학술지 21곳에 실린, 메타분석을 담은 체계적 문헌고찰 313편입니다. 이 중 랜덤효과 모형을 쓴 것이 89%(278편)였습니다. 모형을 미리 정해 둔 것은 49%(152편)였고, 그중 그 선택의 이유를 밝힌 것은 41%(63편)였습니다. 그리고 313편 중 42%(131편)는 분석 결과로 나온 이질성 지표를 보고 나서 모형을 골랐습니다 (PMID 39962342). 이질성 지표는 연구들의 결과가 서로 얼마나 엇갈리는지를 나타내는 숫자이고, 자세한 내용은 「I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법」에서 다룹니다.
계산법 자체의 보고도 성깁니다. 서로 다른 연구를 합칠 때 가장 널리 쓰여 온 계산법이 거짓으로 높은 정밀도, 곧 실제보다 정밀해 보이는 편향된 추정치를 낼 수 있다는 지적이 2014년 이후 두 학술지에 실렸습니다. 그런데도 2015~2022년 상위 종양학 학술지에 실린 연구의 절반이 넘는 55.7%는 랜덤효과 메타분석에서 어떤 방법을 썼는지 자세히 적지 않았습니다. 방법을 적은 쪽에서도 그 계산법이 여전히 지배적이었습니다 (PMID 38219287).
흔한 오해 두 가지
① "메타분석이니 개별 연구 하나보다 항상 낫다"
메타분석이 나중에 나온 대규모 시험의 결과를 얼마나 맞혔는지는 조사마다 다르게 나왔습니다. 이 적중도를 잰 조사가 둘 있는데, 두 조사의 결과는 서로 다릅니다.

1997년 조사는 환자 1,000명 이상이 참가한 대규모 무작위시험 12편을, 같은 주제로 먼저 나온 메타분석 19편과 맞춰 봤습니다. 비교한 결과는 40개였습니다. 두 판정이 얼마나 겹치는지를 0에서 1 사이로 재는 일치도 지표는 0.35였습니다. 저자들은 이를 '보통(fair)' 수준에 그친다고 적었습니다(이 데이터와 양립하는 범위 0.06~0.64). 메타분석이 "효과 있다"고 했을 때 뒤의 시험도 그랬던 비율은 68%였고, "효과 없다"고 했을 때는 67%였습니다. 두 방향의 적중률이 거의 같았습니다.
이 조사는 반대쪽 사실도 함께 적습니다. 두 방법이 낸 값 자체의 차이가 통계적으로 유의했던 것은 40개 중 5개(12%)뿐입니다. 통계적으로 유의하다는 것은 p값이 미리 정한 문턱보다 작았다는 뜻입니다. 판정이 엇갈린 경우는 전부, 한쪽은 유의하다고 하고 다른 쪽은 유의하지 않다고 한 형태였습니다. 저자들이 결론에 적은 것은 이렇습니다. 우리가 본 대규모 시험 12편의 결과는 35%의 경우에 선행 메타분석이 정확히 예측하지 못했다 (PMID 9262498).
2016년 조사는 마취·수술 전후 의학 분야에서 2000년 이후 나온 대규모 시험 18편과 선행 메타분석 44편을 맞췄습니다. 결과 57개 중 35개(61.4%)가 맞았습니다. 그런데 여기서는 두 방향의 적중률이 크게 기울어 있습니다. "효과 있다"고 했을 때 맞은 비율은 22.7%이고, "효과 없다"고 했을 때 맞은 비율은 85.7%였습니다. 메타분석이 "효과 있다"고 할 때 특히 자주 빗나갔다는 뜻입니다. 일치도 지표는 0.094로, 저자들 표현으로는 '약간(slight)'입니다.
이 비대칭은 효과를 잡아내는 힘으로 설명되지 않았습니다. 이 힘을 논문에서는 검정력이라고 적습니다. 양쪽의 추정 검정력은 비슷했고, 연구 규모의 중앙값(줄 세웠을 때 가운데 값)만 대규모 시험 쪽이 컸습니다(4,482 대 1,389). 저자들이 결론에 적은 것은 이렇습니다. 메타분석 쪽에 양성 결과, 곧 "효과 있다"는 결과로 기우는 강한 경향이 있었고, 뒤이은 대규모 시험이 그것을 뒷받침하지 못했다. 그러니 이 분야에서 메타분석 결과에 기대어 임상 판단을 내릴 때는 신중해야 한다는 것입니다 (PMID 28077529).
메타분석의 결론은 시험이 더 쌓이면서 바뀌기도 합니다. 정신건강 분야 메타분석 100편(시험 항목 1,024건, 참가자 99,303명)을 시험이 나온 순서대로 다시 쌓아 계산해 보면, 여덟 편은 어느 시점에 p<0.05에 도달했다가 시험이 더 쌓이자 유의성을 잃었습니다. 대체로 초기 시험의 큰 효과크기가 근거가 쌓이면서 흩어진 경우였습니다. 사망·재발·실패 결과에서는 효과크기가 줄어든 쪽이 늘어난 쪽보다 다소 흔했습니다(157 대 125). 다만 그 차이 자체는 p=0.06으로 문턱을 넘지 않았습니다. 약물치료와 위약을 비교한 경우에 그 경향이 가장 뚜렷했습니다(79 대 51, p=0.009). 저자들의 결론에는 한정어가 붙어 있습니다. 적은 수의 참가자에 기댄 근거는 신중히 해석해야 하고, 약물치료의 초기 효능은 때때로 과대추정된다는 것입니다 (PMID 15612138).
응급의학에서는 각 메타분석 안에서 가장 먼저 나온 연구의 효과가, 평균적으로 전체 요약 효과보다 더 큰 이득을 보였습니다. 메타분석 431개에서 개별 연구 결과 3,129개(83%가 무작위시험)를 뽑아 살핀 결과입니다. 431개 중 실험 치료 쪽이 유리하면서 편향을 의심할 신호가 하나도 없었던 것은 57개(13%)뿐이었습니다. 그중 오즈비 0.70의 효과를 잡아낼 검정력이 80% 이상인 연구를 하나라도 가진 것은 12개였습니다. 오즈비는 두 군의 오즈, 곧 사건이 일어날 가능성을 일어나지 않을 가능성으로 나눈 값끼리 다시 나눈 숫자입니다. 그 12개에서, 검정력을 갖춘 시험이 사망률을 유의하게 낮춘 중재(치료나 처치)는 없었습니다. 저자들의 결론은 이 분야의 체계적 문헌고찰·메타분석이 다룬 중재 가운데 결과를 개선한다는 강하고 치우치지 않은 근거를 가진 것으로 보이는 중재는 적다는 것입니다. 저자들은 반대쪽 사실도 적습니다. 연구들의 검정력은 다소 높아졌지만 여전히 대다수가 부족했고, 그래서 검정력을 제대로 갖춘 시험이 더 필요하다는 것입니다 (PMID 34133813). 여기서 말한 편향의 신호 둘(작은 연구 효과·과잉 유의성)이 무엇인지는 「같은 시험, 다른 결론 — 출판편향과 "무엇을 합쳤는가"」에서 다룹니다.
그러면 메타분석을 믿지 말아야 할까요. 중재종양학 문헌을 조망한 한 리뷰가 그 분야를 두고 내린 답은 이렇습니다. 메타분석은 결정적 기준점이 아니라 방법론적 도구이고, 그 결론은 바탕이 된 연구들의 질·일관성·관련성에 크게 의존한다 (PMID 41942708).
② "랜덤효과가 더 보수적이니 안전하다"
랜덤효과 모형은 구간이 넓게 나옵니다. 그래서 "더 겸손한 선택"으로 통합니다. 이 생각은 절반만 맞습니다.
먼저 검정력, 곧 효과를 잡아내는 힘입니다. 메타분석이 인기 있는 이유 하나는 개별 연구보다 검정력이 세리라는 통념입니다. 이 통념은 고정효과 모형에서는 필연적으로 참입니다. 랜덤효과 모형은 다릅니다. 연구들 사이의 차이의 크기가 계산에 들어가고 그 값을 추정해야 하기 때문에, 검정력에 불리하게 작용할 수 있습니다. 코크런 데이터베이스의 메타분석 1,991개로 소급 계산해 보면, 랜덤효과 메타분석의 검정력이 구성 연구들의 검정력보다 높은 상태를 웬만큼 일관되게 얻으려면 연구가 5편 이상 필요했습니다. 저자들의 표현으로, 연구가 아주 적을 때 랜덤효과 모형의 통계적 추론은 어려울 뿐 아니라 할 가치도 덜합니다 (PMID 28378395). 연구가 몇 편 안 되는 랜덤효과 메타분석은 개별 연구보다 검정력이 세다는 보장이 없다는 뜻입니다.
다음은 무게 자체입니다. 랜덤효과에서 각 연구의 무게는, 그 연구가 낸 값의 분산(흔들림의 크기)에 연구들 사이의 차이의 추정값을 더한 값에 반비례합니다. 이 추정값은 자료에서 계산해 낸 값이라 자료마다 달라지고, 각 연구의 효과크기 추정치와도 상관돼 있습니다. 그래서 연구 수가 많지 않으면 메타분석 추정치에 흔히 쓰는 근사 계산이 매우 부정확합니다 (PMID 26688589). 무게가 우리가 관측한 값이 아니라 추정한 값에 매달려 있기 때문입니다. 다만 같은 논문은 다른 방향의 결과도 보고합니다. 연구 수가 고정돼 있거나 연구 크기보다 느리게 늘어나는 조건에서는, 통상의 메타분석 추정량이 참가자 개인 자료를 다 모아 계산한 추정량보다 언제나 최소한 그만큼은 효율적임을 보입니다 (PMID 26688589). 여기서 효율적이라는 것은 같은 자료로 그만큼 정밀하게 추정한다는 뜻입니다.
고정효과에도 쓸모 있는 자리가 있습니다. 연구들 사이에 상당한 차이가 있는 상황에서도, 정밀도가 우선이라면 고정효과 모형은 가치 있는 도구입니다 (PMID 37858407). 반대로 연구 안의 변이와 연구 사이의 변이를 모두 설명해야 하는 경우에는 랜덤효과가 적합합니다. 연구 간 차이가 크거나 환자·집단의 내재적 차이가 흔한 외과 분야의 메타분석이 그런 예입니다 (PMID 37945406).
정리하면 랜덤효과는 다른 가정 위에 선 모형이고, 그 자체로 더 안전한 선택은 아닙니다. 구간이 넓어지는 까닭은 계산에 불확실한 항, 곧 연구들 사이의 차이의 추정값이 하나 더 들어갔기 때문입니다. 무게가 고르게 퍼진다는 것은 곧 작은 연구의 몫이 커진다는 뜻입니다 (PMID 34550583).
그림 앞에서 물어볼 것
숲그림 한 장을 만났을 때 물어볼 것은 네 가지입니다.
- 줄이 몇 개인가보다, 상자가 어떻게 생겼나. 한 연구가 무게의 대부분을 가져갔다면 마름모는 그 연구의 값에 가깝습니다.
- 각 줄이 연구인가, 변수인가. 개별 연구 하나에서 여러 변수를 함께 넣은 분석도 이 그림으로 그립니다 (PMID 41774848).
- 고정효과인가, 랜덤효과인가. 이 선택은 결과를 보기 전에 개념적 근거로 해야 하는 것이고, 분석 결과를 눈으로 훑어본 뒤에 정하는 것이 아닙니다 (PMID 41180834).
- 이 마름모가 다른 메타분석의 마름모와 같은 시험을 쓰고 있지는 않은가. 같은 시험이 여러 메타분석에 반복해 들어가면 독립된 근거가 여러 개인 것처럼 보입니다 (PMID 40253011).
하나만 남긴다면 이것입니다. 메타분석은 여러 연구의 결과를 단순히 평균 내지 않고, 무게를 나눠 합칩니다. 마름모의 위치는 무게가 어디에 몰렸는지가 정합니다.
이 글이 비워 둔 자리
균형 잡힌 평가 하나를 먼저 놓겠습니다. 한 학술지 논평은 이렇게 적습니다. 체계적 문헌고찰과 메타분석은 1970년대에 도입된 뒤, 비체계적·선별적 종설을 대체해 왔습니다. 종설은 여러 연구를 정리한 글인데, 예전 종설은 접근·구조·내용이 제각각이었습니다. 숲그림이 주는 요약은 개별 연구 하나로는 도달할 수 없는 것이고, 이 도구들은 존중받는 연구 도구들 사이에서 정당한 자리를 갖습니다. 다만 표준 절차가 있는데도 그 질은 편차가 크고, 그래서 양이 질을 앞지르는 데 대한 우려가 정당합니다. 적절한 대응은 이 도구들을 물리치는 것이 아니라, 이 작업이 얼마나 복잡한지에 대한 감각을 연구자에게 심어 더 잘 아는 저자·심사자·편집자를 만드는 것이라고 이 논평은 봅니다 (PMID 36639571).
흉복부 수술 분야에서는 질이 높은 리뷰가 실제로 더 많이 인용됐습니다. 관련 리뷰들의 인용수를 2020년까지 세어 보니, 방법론 질 점수가 높은 쪽이 다른 요인과 독립적으로 인용수와 연관됐습니다. 다만 같은 조사는 겹치는 리뷰가 흔했고, 그 편차가 같은 주제에서 서로 다른 효과크기 추정치를 낳았다고도 적습니다 (PMID 34791075).
이 글은 그림 한 장을 읽는 데까지만 왔습니다. 남은 자리 둘은 「I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법」과 「같은 시험, 다른 결론 — 출판편향과 "무엇을 합쳤는가"」가 이어받습니다.
첫째는 랜덤효과 모형이 가정한 "연구들 사이의 진짜 차이"를 실제로 어떻게 재는가입니다. 그 크기를 나타낸다는 지표들이 있고, 그 지표들이 무엇을 말하고 무엇을 말하지 않는지를 「I²는 흩어짐의 크기가 아니다 — 이질성 지표를 읽는 법」이 다룹니다. 마름모 근처에 그려지곤 하는 또 하나의 구간도 그 편에서 다룹니다.
둘째는 숲그림에 애초에 실리지 않은 연구들입니다. 결과가 시원치 않아 발표되지 않은 연구가 있다면, 이 그림에는 그 연구가 나타나지 않습니다. 그런 연구를 탐지하려는 그림과 방법, 그리고 같은 주제의 메타분석들이 왜 서로 다른 결론에 이르는지는 「같은 시험, 다른 결론 — 출판편향과 "무엇을 합쳤는가"」가 다룹니다.
이 글이 다루지 못한 것들도 있습니다. 근거의 질을 등급으로 매기는 틀, 순차분석, 여러 치료를 한 그물에 놓고 비교하는 형태, 참가자 개인 자료를 모으는 형태, 계속 갱신되는 형태입니다. 메타분석의 해석을 다룬 안내가 이 목록을 정리해 두었습니다 (PMID 39239131).
근거 논문
같은 시험이 여러 번 세어진다
- "The redundant landscape of met…" (2025) — PMID 40253011 — 메타분석 40편, 무작위시험 항목 728건 중 고유 276편(37.9%). 153편은 한 리뷰에만, 123편은 2~19개 리뷰에. 저자 결론은 반복 사용이 "견고함의 착시"를 만들고 강도·다양성이 더 제한적일 수 있다는 것.
- "The methodological quality was…" (2022) — PMID 34718123 — 체계적 문헌고찰 21편인데 발표된 무작위시험은 8편. 18편이 최하 등급, 나머지 1편은 최상 등급(초록 표기 그대로입니다). 세 결과 영역 전부에서 결론 불일치. 저자 결론은 질이 고르게 낮아 질과 결론의 연관을 평가할 수 없었다는 것.
- "The Mass Production of Redunda…" (2016) — PMID 27620683 — 1991~2014 연간 증가율 2,728%(고찰)·2,635%(메타분석) 대 PubMed 전체 153%. 같은 주제 메타분석이 때로 20편 초과. 결론은 조건부("possibly, the large majority").
- "High variability in results an…" (2021) — PMID 34791075 — 2015년 흉복부 수술 리뷰 57편(48주제), 직전 5년 중첩 리뷰 146편이 29주제(60.4%)에. 편차가 같은 주제에서 다른 효과크기 추정치를 낳았습니다. 질 높은 쪽이 5년 인용수와 독립 연관.
메타분석과 숲그림이 무엇인가
- "Understanding the Basics of Me…" (2020) — PMID 33027562 — 여러 연구 결과를 합쳐 모집단의 참값을 더 잘 대표할 수 있는 요약 추정치를 얻는 방법. 평균·비율·상대위험·오즈비 등에 수행 가능. 결과는 숲그림으로.
- "Interpretation of meta-analyse…" (2022) — PMID 39239131 — 단계(체계적 문헌 검색·치우침 위험 평가·자료 추출·자료 합산)와 해석 안내.
- "[Anatomy of the Forest Plot gr…" (2026) — PMID 41774848 — 최근 문헌에서 가장 널리 쓰이는 그래프 중 하나. 처음엔 메타분석용이었으나 지금은 개별 연구 결과에도 쓰인다(신뢰구간을 계산할 수 있으면 질적·양적 변수 모두, 다변량 결과도).
- "Say farewell to bland regressi…" (2024) — PMID 38306346 — 계수를 표로 싣는 관행의 문제와, 모형 여럿을 한 그림에 배열하는 시각화 셋.
- "The orchard plot: Cultivating…" (2021) — PMID 32445243 — 생태·진화에서는 메타분석 하나에 효과크기가 100개를 넘는 일이 흔합니다. 102편 조사에서 고전적 숲그림 사용은 11%. 대안 그림은 개별 효과크기를 정밀도에 비례해 찍습니다.
- "Surgeon-level reporting presen…" (2015) — PMID 25600357 — 가상 자료를 그림으로 만들어 네 집단 각 10명(40명)에게 5분. 비외과 의사와 외과 의사 사이에는 차이 없음. 처방은 일반인에게 다른 표현 방식이 필요할 수 있다는 것.
고정효과와 랜덤효과 — 가정과 무게
- "Fixed- and Random-Effects Mode…" (2022) — PMID 34550583 — 고정효과는 하나의 공통 효과를 가정해 관측 변이를 전부 표집오차로 돌리고, 랜덤효과는 효과 분포의 평균을 추정하며 변이를 표집오차와 연구 간 분산으로 나눕니다. 가장 흔한 형태는 가중평균이고 둘 다 역분산 가중을 씁니다. 랜덤효과는 무게가 더 고르게 퍼져 작은 연구에 더 큰 상대 무게가 가고 큰 연구에는 덜 갑니다. 신뢰구간은 더 넓고, 이질성이 있는데 고정효과를 쓰면 지나치게 좁은 구간이 나올 수 있습니다.
- "Fixed Effect Versus Random Eff…" (2025) — PMID 41180834 — 설계·방법·표본이 대체로 비슷하면 고정효과(참값 하나), 의미 있게 다르면 랜덤효과(참값 여럿). 선택은 개념적 근거로 사전에 해야 하며 결과를 훑어본 뒤 정하는 것이 아닙니다.
- "Demystifying fixed and random…" (2014) — PMID 24692250 — 두 접근은 비슷한 결과를 낼 수도 상반된 결과를 낼 수도 있고, 비슷해도 요약 추정치는 다르게 해석해야 합니다. 랜덤효과에서는 예측구간 병기 권고.
- "Fixed-effect Versus Random-eff…" (2023) — PMID 37858407 — 상당한 연구 간 이질성이 있는 상황에서도 정밀도가 우선순위라면 고정효과 모형은 가치 있는 도구입니다.
- "Fixed-effect Versus Random-eff…" (2023) — PMID 37945406 — 랜덤효과는 연구 내·연구 간 변이를 모두 설명할 수 있어, 이질성이 크거나 환자·집단의 내재적 차이가 흔한 외과 메타분석에 적합합니다.
- "On random-effects meta-analysi…" (2015) — PMID 26688589 — 랜덤효과의 각 연구 무게는 효과크기 추정치의 분산과 랜덤효과 분포의 추정된 분산성분의 합에 반비례합니다. 그 추정값이 확률변수라 연구 수가 크지 않으면 통상의 정규 근사가 매우 부정확합니다. 다른 축의 결과 — 연구 수가 고정이거나 더 느리게 늘 때, 메타분석 추정량은 개인 자료를 쓴 결합 최대우도 추정량보다 늘 최소한 그만큼은 효율적임을 보입니다.
- "Appropriateness of conducting…" (2024) — PMID 38219287 — 가장 널리 쓰인 계산법이 거짓으로 높은 정밀도의 편향된 추정치를 낼 수 있다는 지적에도, 2015~2022년 상위 종양학 학술지 연구의 55.7%가 방법을 자세히 적지 않았습니다.
- "Statistical Heterogeneity in O…" (2025) — PMID 39962342 — 구강보건 학술지 21곳의, 메타분석을 담은 체계적 문헌고찰 313편(2021~2023). 랜덤효과 89%(278편). 사전 모형 결정 49%(152편), 그중 정당화 41%(63편). 42%(131편)는 이질성 지표를 본 뒤 모형 선택.
메타분석이 개별 연구보다 나은가
- "Discrepancies between meta-ana…" (1997) — PMID 9262498 — 대규모 무작위시험 12편 대 선행 메타분석 19편, 결과 40개. 일치도 0.35('보통', 0.06~0.64). 양성 예측 68%·음성 예측 67%. 점추정치 차이가 유의했던 것은 5개(12%)뿐, 불일치는 전부 한쪽만 유의한 형태. 저자 결론은 12편의 결과가 35%의 경우 정확히 예측되지 않았다는 것.
- "Poor agreement in significant…" (2016) — PMID 28077529 — 대규모 시험 18편 대 선행 메타분석 44편, 결과 57개 중 35개(61.4%) 적중. 양성 예측 22.7%·음성 예측 85.7%, 일치도 0.094('약간'). 저자 결론은 메타분석 쪽에 양성 결과로 기우는 강한 경향이 있었고 뒤이은 대규모 시험이 뒷받침하지 못했다는 것, 그리고 그것이 검정력 차이로 설명되지 않는다는 것. 규모 중앙값 4,482 대 1,389.
- "Effect sizes in cumulative met…" (2004) — PMID 15612138 — 메타분석 100편(시험 1,024·참가자 99,303). 8편이 유의성에 도달했다가 상실. 사망·재발·실패 결과에서 감소가 증가보다 다소 흔함(157 대 125, P=.06), 약물 대 위약에서 가장 뚜렷(79 대 51, P=.009). 결론은 초기 효능이 때때로 과대추정된다는 것.
- "An umbrella review of effect s…" (2021) — PMID 34133813 — 메타분석 431개, 개별 결과 3,129개(83%가 무작위시험). 오즈비 중앙값 0.70. 각 메타분석 안에서 최초 연구의 효과가 평균적으로 요약 효과보다 큰 이득. 유리하면서 편향 신호가 없는 것은 57개(13%), 그중 검정력 80% 이상 연구를 하나라도 가진 것 12개, 그 안에서 사망률을 유의하게 낮춘 중재는 없음.
- "Power analysis for random-effe…" (2017) — PMID 28378395 — 메타분석이 검정력을 높인다는 것은 고정효과에서는 필연적으로 참이나, 랜덤효과에서는 연구 간 분산을 추정해야 해 불리할 수 있습니다. 코크런 메타분석 1,991개 소급 계산: 구성 연구들보다 높은 검정력을 웬만큼 일관되게 얻으려면 연구 5편 이상 필요.
- "Meta-Analysis: The Holy Grail?" (2026) — PMID 41942708 — 중재종양학 문헌 조망 리뷰. 결론은 메타분석이 결정적 기준점이 아니라 방법론적 도구이며 그 결론이 바탕 연구들의 질·일관성·관련성에 크게 의존한다는 것.
- "Missing the forest-plot for th…" (2023) — PMID 36639571 — 학술지 논평(원저 아님). 체계적 문헌고찰이 종설을 대체해 온 역할과 숲그림이 주는 요약의 가치를 인정하면서 질의 편차와 "양이 질을 앞지르는" 우려를 함께 적습니다. 대응은 배척이 아니라 더 잘 아는 저자·심사자·편집자를 만드는 것.