Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

점수는 올랐다. 그런데 무엇이 올랐나

오염·포화·틀린 정답·구인타당도·채점자·재현성 — 언어모델을 재는 자를 여섯 갈래로 뜯어봅니다. 「재는 일이 어렵다」와 「잴 수 없다」는 다릅니다

🔥논쟁✦AI 생성컴퓨터과학·AI · 2026년 10월 8일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

점수는 올랐다. 그런데 무엇이 올랐나

재는 자를 의심할 차례

언어모델에 관한 주장은 거의 모두 숫자 하나로 압축됩니다. 어떤 시험에서 몇 점을 받았다는 숫자입니다. 언어모델은 글을 받아 그 뒤에 이어질 글을 내놓는 모델이고, 그 시험이 벤치마크입니다. AI 첫걸음 「AI의 오류」의 말로 벤치마크는 여러 AI 모델에게 같은 문제를 풀게 해 점수를 견주도록 만들어 둔 시험 문제 모음입니다. 새 모델이 나오면 점수 표가 함께 나오고, 이 숫자가 오르면 우리는 능력이 올랐다고 말합니다.

환각이 얼마나 잦은지, 추론이 어디서 무너지는지, 모델에게 건네는 지시문인 프롬프트를 바꾸면 무엇이 달라지는지를 말할 때도 근거는 결국 어떤 시험에서 나온 숫자입니다. 그러니 마지막에는 그 시험지를 봐야 합니다.

이 글이 의심하는 문장은 「점수가 오르면 능력이 오른 것이다」입니다. 점수가 올라도 무엇이 올랐는지는 모를 수 있습니다. 이것은 측정이라는 일에 원래 붙어 있는 문제입니다. 시험 점수는 능력을 짐작한 값, 곧 추정치이고, 추정치와 능력 사이에는 여러 겹의 가정이 놓여 있습니다. 이 글은 그 가정이 깨지는 자리를 여섯 갈래로 봅니다. 시험 문제가 학습 데이터에 섞여 드는 오염, 시험이 너무 쉬워져 차이가 사라지는 포화, 정답이 틀린 시험지, 시험이 이름표에 적힌 능력을 재는지를 묻는 구인타당도, 채점자, 다시 쟀을 때 같은 값이 나오는지를 묻는 재현성입니다.

가운데 '점수(능력의 추정치)' 상자로 여섯 상자에서 화살표가 모이는 지도. 왼쪽은 오염·포화·틀린 정답, 오른쪽은 구인타당도·채점자·재현성이고 각 상자에 본문의 한 줄이 적혀 있다. 아래에 '재는 일이 어렵다 ≠ 잴 수 없다'.

근거도 먼저 밝혀 둡니다. 여기 인용한 문헌은 거의 전부 arXiv에 공개된 프리프린트입니다. 프리프린트는 동료심사를 거치기 전에 공개한 판입니다. 오염을 다룬 입장문 한 편(arXiv:2310.18018)은 학회 지면(EMNLP Findings)에 실린 판이 첫걸음 「AI의 오류」에서 확인됩니다. 나머지 가운데 일부도 이후 동료심사 지면에 실렸을 수 있지만 이 글은 그 여부를 확인하지 않았습니다. 재는 자를 의심하는 글이 심사 여부를 확인하지 않은 문헌 위에 서 있다는 것 자체가 이 글이 말하려는 바의 예시입니다. 근거에는 등급이 있고, 등급을 밝히지 않은 근거는 자기 등급을 숨긴 것입니다. 아래 수치는 모두 「그 연구가 자기 설정에서 그 시점에 관측해 스스로 보고한 값」으로 읽으면 됩니다.

먼저, 벤치마크가 한 일

자를 의심하기 전에 그 자가 무엇을 했는지부터 말하는 것이 공정합니다.

함께 쓰는 시험지가 없던 시절에는 저마다 자기 데이터로 자기 숫자를 냈고, 그 숫자들은 서로 비교되지 않았습니다. 2013년의 한 프리프린트는 통계로 다음 낱말을 맞히는 언어모델의 진보를 재려고 거의 10억 단어 규모의 벤치마크 말뭉치를 내놓았습니다. 비교의 출발점인 기준선은 바로 앞 낱말 몇 개만 보고 다음 낱말을 맞히는 옛 통계 모델(5-gram)이었습니다. 성적은 혼란도(perplexity), 곧 모델이 다음 낱말을 얼마나 헷갈려하는지 나타내는 값으로 쟀고, 낮을수록 잘 맞힌 것입니다. 기준선의 혼란도는 67.6이었고 여러 기법을 조합하면 35% 줄었습니다(arXiv:1312.3005). 기준선을 공개하고 모두가 그 위에서 겨루는 방식을 제안한 것입니다.

벤치마크는 이 분야를 여기까지 끌고 온 장치입니다. 이 글은 그 장치를 버려야 한다는 글이 아닙니다. 그 장치가 지금 어떤 하중을 받고 있는지를 봅니다.

오염 — 시험 문제가 학습 데이터에 섞여 들었다면

첫 번째 문제는 「AI의 오류」의 「시험지를 미리 본 수험생」 절이 정의와 실측까지 세웠습니다. 벤치마크 오염은 시험 문제나 그와 아주 비슷한 글이 모델의 학습 데이터에 미리 섞여 들어가는 일이고, 오염된 모델은 그 시험에서 실력보다 높은 점수를 받을 수 있습니다. 그 탓에 틀린 과학적 결론이 발표되고 옳은 결론이 버려질 수 있는데, 문제의 규모는 재기가 쉽지 않아 알려져 있지 않습니다(arXiv:2310.18018, 2023년 입장문, EMNLP Findings 게재). 이 글은 그다음 물음, 오염을 지우고 가려낼 수 있는가를 봅니다.

지우는 방법부터 구멍이 있습니다. 오염 제거는 대부분 문자열 매칭, 곧 시험 문제와 같은 글자 조각이 학습 데이터에 그대로 있는지 찾는 방식에 기댑니다. 연달아 놓인 낱말 몇 개가 겹치는지 보는 n-gram 중복 검사가 대표적입니다. 시험 문제를 다른 말로 풀어 쓰거나 다른 언어로 옮기기만 해도 이런 오염 제거를 피해 갈 수 있습니다. 더 강한 제거 도구를 돌리자 대형 공개 말뭉치 두 곳에서 한 코드 생성 벤치마크의 8~18%가 겹쳤고, GPT-3.5와 GPT-4가 만든 합성 데이터셋에서도 같은 오염이 나왔습니다(arXiv:2311.04850, 2023년 프리프린트). 저자들은 이를 누가 일부러 넣지 않아도 오염이 흘러들 수 있는 위험으로 봤습니다. 문항마다 분포가 같은 짝 문항을 만들어 모델이 원래 문항에서 유의하게 더 확신하는지 검정한 연구에서는, 시험한 거의 모든 공개 모델과 벤치마크가 크든 작든 오염이 의심됐습니다(arXiv:2406.18326, 2024년 프리프린트).

오염을 가려내는 도구는 믿을 만한가

오염 탐지법은 저마다 가정 위에 서 있습니다. 2024년의 한 서베이는 오염 탐지 논문 50편을 검토해 그 가정들을 여덟 범주로 나누고, 그중 세 가정을 멤버십 추론으로 시험했습니다. 멤버십 추론은 어떤 글 한 편이 모델의 학습 데이터에 들어 있었는지를 맞히려는 방법입니다. 결과는 불편합니다. 이 가정들에 기댄 멤버십 추론은 사전학습에 쓰인 데이터셋에서 무작위로 찍는 것과 비슷한 성능을 낼 수 있었습니다. 저자들은 이를 그 언어모델들이 개별 사례를 외우기보다 데이터의 분포를 배우고 있을 가능성으로 해석했습니다. 본 데이터와 보지 않은 데이터 사이에 분포 이동, 곧 두 데이터가 나오는 분포의 차이가 있으면 이런 방법이 쉽게 실패한다는 점도 지적했습니다(arXiv:2410.18966).

이 해석이 맞다면 무게가 큽니다. 오염을 「봤다/안 봤다」로 가르려면 모델이 개별 사례를 기억한다는 그림이 필요합니다. 모델이 분포를 배우는 것이라면 「봤다/안 봤다」라는 이분법 자체가 잘 정의되지 않습니다.

다른 연구는 다섯 가지 탐지법을 2024년 당시 최신 모델 네 개와 까다로운 데이터셋 여덟 개에 적용했습니다. 그 시점의 탐지법들은 가정과 실제 적용 양쪽에서 작지 않은 한계를 지녔습니다. 지시 미세조정, 곧 지시와 그에 맞는 대답을 짝지은 예시로 모델을 한 번 더 학습시키는 단계에서 답변 증강과 함께 들어온 오염은 특히 가려내기 어려웠습니다. 그리고 최신 탐지 기법끼리 판정의 일관성이 제한적이었습니다(arXiv:2409.09927, 2024년 프리프린트). 탐지기마다 다른 답을 내면, 어느 쪽이 맞는지 판정할 심판이 없습니다.

오염은 실재하고, 한 탐지 연구에서는 시험한 거의 모든 공개 모델과 벤치마크에서 크든 작든 의심됐으며, 문자열 매칭으로는 지워지지 않습니다. 다만 「AI의 오류」가 짚었듯 가장 앞선 모델들을 비롯한 많은 모델은 오염의 흔적이 적었고, 모든 점수가 외워서 나온 것은 아닙니다. 그 의심을 내리는 탐지기들끼리도 판정이 엇갈립니다. 탐지기가 「깨끗하다」고 말할 때 그 말이 무슨 뜻인지조차 아직 확립돼 있지 않습니다. 「이 점수는 오염되지 않았다」는 주장은 이 연구들이 보여 준 범위에서 대체로 검증되지 않은 주장입니다.

포화 — 모두가 천장 근처에 몰린 시험

두 번째 문제는 시험이 너무 쉬워졌을 때 생깁니다. 포화는 모델들의 점수가 천장 가까이 몰려, 그 벤치마크로는 모델 사이의 차이를 가리기 어려워진 상태입니다. 60개의 언어모델 벤치마크를 포화와 관련된 14개 속성으로 분석한 2026년 연구에서는 대략 절반이 포화를 보였고, 오래된 벤치마크일수록 그 비율이 높았습니다. 포화를 버티는 힘에 영향을 준 것은 전문가가 문항을 골라 다듬는 전문가 큐레이션이었고, 테스트 데이터의 공개 여부는 아니었습니다(arXiv:2602.16763).

천장에 닿으면 모델 사이에 남는 차이가 작아집니다. 작아진 차이가 실력 차인지 우연한 흔들림인지 가리려면 흔들림의 크기를 알아야 합니다. 그 크기를 재는 일은 드물었습니다. 2024년의 한 연구는 벤치마크의 분산, 곧 조건을 조금 바꿔 다시 쟀을 때 점수가 흔들리는 폭을 쟀습니다. 학습을 시작할 때의 무작위 초깃값인 시드에 따른 흔들림, 학습 도중 점수가 꾸준히 오르는지 같은 것들입니다. 객관식 문항을 빈칸 잇기 꼴로 바꾸는 것 같은 단순한 변경은 작은 규모 모델에서 분산을 줄이는 경우가 많았습니다. 반면 사람의 시험을 다루는 문헌에서 가져온 문항 분석이나 문항반응이론(뒤의 대안에서 다시 봅니다) 같은 정교한 방법들은 분산을 의미 있게 줄이는 데 고전했습니다(arXiv:2406.10229).

개념도 두 칸. 왼쪽은 네 모델의 점수가 서로 떨어져 있고 흔들림 막대가 겹치지 않는다. 오른쪽은 네 점수가 천장 바로 아래 몰려 흔들림 막대가 서로 겹친다. 실제 수치가 아니다.

통계 습관에도 구멍이 있습니다. 오차 막대는 점수 옆에 실제 값이 들어 있을 법한 폭을 그어 둔 표시입니다. 언어모델 평가의 오차 막대와 유의성 검정은 대개 중심극한정리, 곧 문항이 충분히 많으면 평균 점수의 흔들림이 종 모양 분포를 따른다는 정리에 기댑니다. 2025년의 한 입장 논문은 이 방법이 수천 개 예제로 된 벤치마크에는 알맞지만 작고 전문화된 벤치마크에서는 불확실성을 대체로 심하게 과소평가한다고 지적하고, 대신 쓸 빈도주의·베이즈 방법을 권했습니다(arXiv:2503.01747). 오차 막대가 실제보다 좁게 그려진다는 뜻입니다. 저자들은 이런 작은 벤치마크 상황이 점점 흔해지고 있다고 봅니다.

포화는 재려던 것을 가려 버리기도 합니다. 실제로 쓰는 자리에서는 99.9%와 99.999%의 차이가 실패 건수의 자릿수를 바꿉니다. 이렇게 드문 실패의 확률을 좁은 신뢰구간, 곧 참값이 들어 있을 법한 좁은 범위로 추정하려면, 입력을 고르게 뽑아 돌려 보는 표준 방식(몬테카를로)으로는 감당하지 못할 만큼 모델을 많이 돌려야 합니다. 2026년의 한 연구는 실패가 특정 입력에 몰리는 성질을 이용해 실패가 잦은 입력 쪽으로 표본을 뽑아, 필요한 횟수를 크게 줄였습니다. 그 결과 표준 벤치마크에서 정확도가 구별되지 않는 모델들도 추정된 실패율은 상당히 다를 수 있었습니다(arXiv:2605.11209). 같은 점수가 같은 물건을 뜻하지 않습니다.

흔한 대응은 더 어려운 시험을 만드는 것입니다. 널리 쓰이던 한 다과목 지식 벤치마크의 확장판은 추론 중심 문항을 넣고, 선택지를 4개에서 10개로 늘리고, 잡음이 많은 문항을 뺐습니다. 정확도는 원본보다 16~33% 떨어졌고, 24가지 프롬프트 양식에 따라 점수가 흔들리는 폭은 4~5%에서 2%로 줄었습니다(arXiv:2406.01574).

그런데 이 대응 자체가 돌고 돕니다. 2025년의 한 논문은 이 순환을 제 꼬리를 무는 뱀, 우로보로스라 불렀습니다. 모델의 능력이 오르고, 많은 경우 그 데이터셋이 학습에 들어갔을 가능성까지 겹쳐 결과가 포화되면, 더 어려운 대체물이 또 필요해집니다. 저자들의 질문은 이 글의 질문과 같습니다. 벤치마크를 넘어섰다는 것이 정말 추론 능력을 보인 것인가, 아니면 재겠다고 한 능력과 동떨어진 숫자를 좇고 있는 것인가(arXiv:2511.01365).

정답이 틀린 시험지

오염도 없고 포화도 아닌 시험이라고 가정하겠습니다. 그래도 정답 자체가 틀린 문항이 남을 수 있습니다.

2024년의 한 연구는 널리 쓰이는 다과목 지식 벤치마크에서 57개 과목 전체에 걸친 5,700문항을 사람이 다시 검토해 정답을 매겼습니다. 이를 바탕으로 이 벤치마크 전체 문항의 6.49%에 오류가 있을 것으로 추정했고, 분석한 바이러스학 문항에서는 57%에 오류가 있었습니다. 다시 매긴 문항으로 채점하자 원래 보고된 성능 지표와 유의하게 어긋났습니다(arXiv:2406.04127).

100칸 격자에서 약 6.5칸이 빨갛게 칠해져 있다. MMLU 전체 문항 가운데 오류가 있을 것으로 추정된 몫 6.49%. 57개 과목 5,700문항을 사람이 다시 검토한 추정치이며, 다시 매긴 정답으로 채점하면 원래 보고된 성능과 유의하게 어긋났다.

언어모델만의 문제도 아닙니다. 2021년의 한 연구는 컴퓨터 비전·자연어·오디오 분야에서 가장 널리 쓰이는 데이터셋 10개의 테스트셋, 곧 실력을 잴 때만 쓰려고 떼어 둔 문항에서 정답 표시(라벨)의 오류를 찾았습니다. 알고리즘이 틀렸을 법한 후보를 뽑고 크라우드소싱으로 사람이 확인했는데, 지목된 후보의 평균 51%가 실제로 틀려 있었습니다. 오류는 10개 데이터셋 평균 최소 3.3%였고, 한 대표적 이미지 데이터셋의 검증 집합에서는 최소 6%였습니다.

가장 중요한 관측은 오류가 순위를 뒤집는다는 것입니다. 어떤 모델을 쓸지는 관행적으로 테스트 정확도를 보고 정하는데, 라벨을 고친 뒤 다시 재면 순위가 달라질 수 있었습니다. 원래 라벨이 틀려 있던 테스트 사례의 비율이 6%(논문 표기 그대로)만 늘어도, 층이 적은 잔차망이 더 깊은 잔차망을 앞섰습니다. 잔차망은 층을 깊이 쌓은 신경망의 한 종류입니다. 라벨 잡음이 많은 실제 데이터에서는 용량이 작은 모델이 실용적으로 더 쓸모 있을 수 있다는 것입니다(arXiv:2103.14749). 시험지의 오류는 점수를 조금 깎는 데서 끝나지 않고 순서까지 바꿀 수 있습니다.

정답이 맞는데도 재려는 것을 재지 못하는 경우가 있습니다. 주석 아티팩트는 사람이 데이터를 만드는 과정에서 문항에 남은 흔적으로, 모델이 과제를 실제로 풀지 않고도 정답을 찾게 해 주는 단서입니다. 2023년의 한 프리프린트는 대형 사전학습 모델이 높은 점수를 내면서도 훈련·검증·테스트 데이터에 공통으로 남은 이런 흔적에 기대어 정답을 찾는 현상을, 두 문장 사이의 논리 관계를 맞히는 자연어 추론 과제에서 살폈습니다. 저자들은 일부러 비틀어 만든 예제들(대조 예제와 적대적 예제)로 성능의 한계를 드러내고, 주석자가 훈련 데이터를 만든 방식에서 생긴 편향 하나를 보인 뒤, 이를 바로잡는 데이터 증강 기법을 제안했습니다(arXiv:2302.04700).

아티팩트에 기대어 정답을 맞힌 모델은 문항을 틀리지 않았습니다. 다만 우리가 재려던 일을 하지 않았을 뿐입니다.

구인타당도 — 시험이 이름표에 적힌 능력을 재는가

여기가 이 글의 중심입니다. 앞의 세 문제는 「이 시험이 제대로 치러졌는가」를 묻습니다. 네 번째 문제는 이 시험이 이름표에 적힌 그 능력을 재는지를 묻습니다.

구인타당도는 어떤 시험이 재겠다고 내세운 개념, 곧 구인을 그 시험이 실제로 재는 정도입니다. 사람의 능력과 성향을 재는 법을 다루는 심리측정학의 말입니다. 지능이나 불안은 자로 직접 잴 수 없어서, 문항을 만들어 응답을 받고 그 응답이 재려는 개념을 대표한다고 가정합니다. 그 가정이 타당한지 따지는 것이 구인타당도입니다. 「추론 능력」「안전성」「언어 이해」가 바로 이런 개념인데, 벤치마크 이름에는 이런 낱말이 아무 유보 없이 들어갑니다.

2025년의 한 프리프린트는 이 틀을 기계학습 벤치마크 전반에 적용했습니다. 저자들의 논지는 이렇습니다. 벤치마크 점수는 기껏해야 특정 평가 데이터셋과 구체적인 학습 문제에 상대적인 성능을 잰 값입니다. 여기서 이미지 분류 같은 과제 일반에 관한 과학적 결론을 끌어내려면 학습 문제의 이론적 구조, 평가 함수, 데이터 분포에 관한 추가 가정이 필요합니다. 저자들은 심리측정 이론을 빌려 그 가정들을 구인타당도의 조건으로 명시했습니다(arXiv:2510.23191).

그 조건이 실제로 얼마나 지켜지는지는 2025년의 한 체계적 리뷰가 셌습니다. 29명의 전문 검토자가 자연어처리·기계학습 주요 학회의 언어모델 벤치마크 445개를 검토하자, 무엇을 재려는지, 어떤 과제를 쓰는지, 어떻게 채점하는지에서 결과 주장의 타당성을 훼손하는 패턴들이 나왔습니다. 저자들은 여덟 가지 핵심 권고와 실행 지침을 내놓았습니다(arXiv:2511.04703).

인과추론 벤치마크가 구체적인 예입니다. 2024년의 한 리뷰에 따르면, 언어모델이 원인과 결과를 따지는 능력을 평가하겠다는 벤치마크 가운데 많은 것이 해당 분야의 지식을 찾아 꺼내기만 해도 풀릴 가능성이 높습니다. 저자들은 그 무렵의 벤치마크가 개입(무엇을 바꾸면 어떻게 되는가)과 반사실(그때 달랐다면 어땠을까)을 묻는 쪽으로 옮겨 가는 흐름을 짚고, 쓸모 있는 벤치마크의 기준들을 내놓았습니다(arXiv:2407.08029). 「인과추론 점수」라는 이름의 숫자가 실은 지식 검색 점수일 수 있다는 뜻입니다.

의학 쪽도 같습니다. 의료 언어모델 연구는 임상 지식을 담고 있다거나 의사처럼 추론한다는 대담한 주장의 근거로 벤치마크 성적을 댑니다. 2025년의 한 입장 논문은 그 벤치마크들이 대체로 의사면허시험 문항으로 임의 구성돼 있다고 지적하고, 실제 임상 데이터로 개념 증명 수준에서 평가해 구인타당도의 유의한 격차를 보고했습니다(arXiv:2503.10694). 면허시험을 잘 보는 것과 진료를 잘하는 것이 같은 일이 아니라는 것은 사람에 대해서도 우리가 이미 아는 사실입니다.

오래된 우려도 하나 붙어 있습니다. 실력을 재려고 떼어 둔 같은 시험 문항(홀드아웃 집합)의 점수를 보며 여럿이 거듭 모델을 고르고 고치면, 결과가 그 문항에 맞춰질 수 있다는 우려입니다. 그 크기가 얼마인지는 이 글이 인용한 연구들이 재지 않았습니다. 이 우려가 맞다면, 시험이 목표가 되는 순간 시험은 조금씩 시험이기를 그만둡니다.

채점자 — 언어모델이 채점할 때 점수에 섞이는 것

요약이 좋은지, 답이 도움이 되는지처럼 정답이 하나로 정해지지 않은 글을 평가하려면 채점자가 필요합니다. 사람 채점자는 비싸고 느려서 다른 언어모델에게 채점을 맡기고, 이 모델을 모델 심판이라 부릅니다. 주요 학회 네 곳의 14,171편에서 정보를 뽑아 자연어 생성 관련 3,334편을 분석한 2026년 메타분석에서는, 2025년에 모델 심판이 사람 평가보다 더 많은 논문에 등장했습니다. 모델 심판이 빠르게 늘어난 만큼 사람의 판정과 맞춰 보는 검증은 따라붙지 못해, 그런 검증을 한 논문은 8% 미만이었습니다. 모델 심판은 전체 품질과는 상관을 보여도 유창성 같은 세부 기준에서는 어긋났습니다(arXiv:2601.07648).

모델 심판이 매긴 값이 벤치마크 점수가 되면 심판의 버릇도 점수에 섞이고, 어느 벤치마크로 검증했느냐에 따라 심판의 순위도 달라집니다. 21개 심판 모델을 세 벤치마크에서 비교한 2026년 연구에서 그 순위는 최대 14계단까지 움직였습니다. 같은 연구는 심판을 검증할 때 흔히 쓰는 단순 일치율이 우연히 맞는 몫을 빼지 않아 심판의 판별력을 체계적으로 부풀린다고 지적합니다. 같은 판정을 꾸준히 내는 심판(재검사 신뢰도 0.95 초과)이 답이 놓인 자리에 따라 판정이 끌리는 위치 편향을 심하게 보이는 「일관성–편향 역설」도, 실제로 배치된 심판 두 곳에서 관측됐습니다(arXiv:2606.19544). 같은 답을 꾸준히 낸다는 것과 맞게 잰다는 것은 다른 일입니다.

기준점이 되는 사람 평가도 단단하지 않습니다. 한 주요 학회의 2020년 논문 가운데 사람 평가를 보고한 10편을 무작위로 뽑아 보니, 문제 정의·방법·평가가 완전히 맞물린 논문은 한 편뿐이었습니다(arXiv:2104.05361, 표본 10편). 2023년의 한 조사에서 재현 후보가 될 만한 논문은 13%에 그쳤고, 저자들은 사람 평가 대다수가 반복·재현이 어렵거나 결함이 크다는 결론을 「암울한 그림」이라 부르면서 다시 설계할 기회라고도 적었습니다(arXiv:2305.01633). 모델 심판이 기존 자동 지표보다 사람의 판정에 가까운 과제도 있어(arXiv:2502.06193, 2025년 소프트웨어 공학 과제), 얼마나 믿을지는 과제마다 따로 정해야 합니다. 심판의 편향과 되풀이 판정의 흔들림은 「채점자도 언어모델이다 — 그 판정을 어디까지 믿을 수 있는가」로 넘깁니다.

재현성 — 같은 시험을 다시 치면

마지막 문제가 가장 기본적입니다. 같은 모델을 같은 벤치마크로 다시 재면 같은 값이 나오는지입니다.

포화에서 본 확장판 벤치마크는 24가지 프롬프트 양식에 따른 점수 흔들림을 4~5%에서 2%로 줄였습니다(arXiv:2406.01574). 뒤집어 읽으면, 개선 전에는 프롬프트 양식만 바꿔도 점수가 그만큼 움직였다는 말입니다. 시드에 따른 분산과 학습 도중 점수가 꾸준히 오르지 않는 현상도 측정돼 있습니다(arXiv:2406.10229). 같은 이름의 모델이 시간이 지나며 달라질 때의 재현성은 「내가 맡긴 그 모델이 아니다」로 넘깁니다.

그래도 잰다 — 문헌 안의 대안들

여섯 문제를 지나오면 냉소가 자연스러운 반응처럼 보입니다. 그런데 이 문헌이 실제로 하는 일은 냉소와 거리가 멉니다. 위에서 인용한 논문들은 대부분 문제를 지적하는 데서 멈추지 않고 다음 자를 제안합니다. 다섯 갈래입니다.

첫째 갈래는 동적 평가입니다. 동적 벤치마크는 고정된 시험지 대신 문항을 계속 새로 만들어 가는 벤치마크입니다. 2021년의 한 플랫폼에서는 문항을 만드는 사람이 대상 모델은 틀리지만 다른 사람은 틀리지 않을 예제를 만들려고 시도합니다. 저자들은 2021년 당시의 모델이 벤치마크 과제에서는 뛰어나도 단순한 도전 예제에서 실패하고 실제 상황에서 흔들린다고 지적하며, 데이터셋 만들기·모델 개발·모델 평가가 서로에게 곧바로 정보를 주는 구조를 제안했습니다(arXiv:2104.14337). 이 흐름을 개관한 2025년의 서베이는 고정된 벤치마크를 보강하는 방법들의 내재적 한계를 짚고, 동적 벤치마크를 평가할 표준화된 기준이 없다는 것을 결정적 공백으로 꼽습니다(arXiv:2502.17521). 새 자를 만들었는데 그 자를 검사할 자가 아직 없습니다.

둘째 갈래는 오염을 견디는 설계입니다. 2024년의 한 벤치마크는 의도치 않은 유출에는 더 넓은 분야에서 문항을 가져오고 세 가지 오염 제거 규칙을 세웠습니다. 의도적 유출에는 난이도와 과목 분포가 비슷한 검증 집합과 테스트 집합으로 나눠, 검증 집합만 공개하고 테스트 집합은 비공개로 두었습니다(arXiv:2412.15194). 그런데 앞의 포화 연구는 포화를 버티는 힘에 영향을 준 것이 전문가 큐레이션이었고 테스트 데이터의 공개 여부는 아니었다고 관측했습니다(arXiv:2602.16763). 하나는 오염을, 다른 하나는 포화를 보니 두 결과가 곧바로 부딪히지는 않습니다. 다만 「비공개가 답이다」라는 결론은 아직 이릅니다.

셋째 갈래는 심리측정으로 돌아가는 길입니다. 문항반응이론은 문항마다 난이도와 변별도(실력이 높은 쪽과 낮은 쪽을 가르는 힘)가 다르다고 보고, 응답 패턴에서 숨은 실력을 추정하는 방법입니다. 2025년의 한 프레임워크는 이 이론으로 앞 문항의 결과에 따라 다음 문항을 고르는 적응형 검사를 짜서, 필요한 문항 수를 최대 90%까지 줄였다고 보고합니다. 정확도가 같은 대상끼리도 실력 추정이 갈려, 3,000개가 넘는 평가 대상 가운데 23~31%가 순위에서 10계단 넘게 움직였습니다(arXiv:2511.04689). 다만 앞의 분산 연구는 문항반응이론 같은 방법이 분산을 의미 있게 줄이는 데는 고전했다고 보고했습니다(arXiv:2406.10229). 문항을 아끼는 데 쓸모 있는 도구가 흔들림까지 줄여 주는지는 따로 봐야 합니다.

넷째 갈래는 드문 실패를 겨냥한 표집입니다. 포화한 벤치마크에서 신뢰성을 재려면 정확도 대신 실패율을 보고, 실패가 몰리는 입력에 표본을 집중해야 한다는 접근입니다(arXiv:2605.11209). 작은 벤치마크에서 중심극한정리 대신 쓸 통계 방법들도 제안돼 있습니다(arXiv:2503.01747).

다섯째 갈래는 점수에 유통기한을 붙이는 것입니다. 2026년의 한 입장 논문에 따르면, 평가가 섞어 쓰는 자동 지표·모델 심판·사람 평가·벤치마크 결과를 평균으로 합치면 평가에 대한 확신이 가장 약한 신호의 신뢰도를 크게 넘어설 수 있습니다. 저자들은 이를 「신뢰 팽창」이라 부르고, 평가 점수를 세 성질을 지닌 주장으로 다뤄야 한다고 제안합니다. 형식성(사람 평가가 자동 지표보다 강한 증거라는 것), 범위(벤치마크 결과는 시험된 분포에 적용될 뿐이라는 것), 그리고 타당 기간(오염이 쌓이고 분포가 옮겨 가면 벤치마크 결과는 만료된다는 것)입니다. 평가 결과가 형식성 등급·범위 선언·만료일이라는 꼬리표를 달고 다녀야 한다는 주장입니다. 한 공개 리더보드의 54개 모델과 열 개 시나리오에서, 평균 점수로 뽑은 상위 다섯과 가장 약한 신호로 뽑은 상위 다섯은 하나도 겹치지 않았습니다(arXiv:2607.26191).

무엇이 남나

이 글을 꿰는 구분은 하나입니다. 「재는 일이 어렵다」와 「잴 수 없다」는 다릅니다.

앞의 말은 이 문헌 전체가 하고 있고, 뒤의 말은 아무도 하지 않습니다. 445개 벤치마크를 검토한 팀은 여덟 가지 권고로 끝맺었습니다(arXiv:2511.04703). 탐지 가정이 무작위로 찍는 수준의 성능을 낼 수 있다는 것을 발견한 팀은 그것을 모델이 개별 사례를 외우기보다 분포를 배우고 있을 가능성으로 읽었습니다(arXiv:2410.18966). 다섯 가지 탐지법을 교차 검토한 팀은 더 견고하고 일반화되는 오염 평가 연구가 시급하다고 적었습니다(arXiv:2409.09927). 사람 평가의 재현 불가능성을 「암울한 그림」이라 부른 팀은 같은 대목에서 그것이 다시 설계할 기회라고 적었습니다(arXiv:2305.01633). 자를 의심하는 사람들은 자를 버리려는 사람들과 다릅니다. 오히려 자를 가장 열심히 만드는 사람들입니다.

이 문헌에서 끌어낼 수 있는 점수 읽는 습관은 세 가지입니다.

첫째, 점수를 사실이 아니라 주장으로 읽습니다. 어떤 분포에서, 언제, 누가 채점해 잰 것인지가 붙어 있지 않은 점수는 범위와 유통기한을 숨긴 주장입니다(arXiv:2607.26191).

둘째, 차이를 흔들림과 견줍니다. 두 숫자의 차이가 의미 있는지는 그 벤치마크의 분산을 모르면 판정할 수 없습니다(arXiv:2406.10229). 작은 벤치마크에서는 표준적인 오차 막대가 불확실성을 과소평가할 가능성이 큽니다(arXiv:2503.01747).

셋째, 이름과 재는 대상을 떼어 봅니다. 벤치마크 이름에 「추론」이 들어 있다는 사실은 그것이 추론을 잰다는 증거가 되지 못합니다. 그 연결은 따로 논증해야 하고, 그 논증의 이름이 구인타당도입니다(arXiv:2510.23191).

미해결로 남겨야 할 것들도 있습니다.

오염 탐지에는 오라클, 곧 무엇이 정답인지 알려 주는 기준이 없습니다. 어떤 모델이 무엇을 학습했는지의 참값을 우리는 대개 모릅니다. 학습 말뭉치가 전부 공개되지 않기 때문이기도 하고, 모델이 분포를 배우고 있다는 해석이 맞다면 「봤다/안 봤다」라는 이분법 자체가 잘 정의되지 않기 때문이기도 합니다(arXiv:2410.18966). 참값을 모르는 채로 탐지기를 검증하는 문제는 열려 있습니다(arXiv:2409.09927).

사람 평가라는 기준점도 흔들립니다. 모델 심판의 편향을 재려면 사람의 판정을 기준으로 삼아야 하는데, 사람 평가 자체의 정렬과 재현성이 확립돼 있지 않습니다(arXiv:2104.05361, arXiv:2305.01633). 이 순환을 어떻게 끊을지는 풀리지 않았습니다.

새 자에도 자가 필요합니다. 동적 벤치마크를 평가할 표준 기준이 없고(arXiv:2502.17521), 심리측정 도구가 분산 문제를 반드시 줄여 주지도 않습니다(arXiv:2406.10229).

마지막으로 이 글 자신에게 같은 잣대를 댑니다. 여기 인용한 문헌은 학회 게재가 확인된 입장문 한 편을 빼면 arXiv에 공개된 프리프린트이고, 이 글은 그 나머지 가운데 어느 것이 동료심사를 통과했는지 확인하지 않았습니다. 그 안의 수치는 각 연구가 자기 자리에서 관측해 스스로 보고한 값이고, 서로를 검증한 값이 아닙니다. 범위와 시점과 근거의 등급을 밝혀야 한다는 이 글의 요구는 이 글에도 똑같이 적용됩니다.

숫자를 믿지 말아야 한다는 뜻이 아닙니다. 숫자가 무엇을 믿어 달라고 요구하는지를 보아야 한다는 뜻입니다. 점수 옆에는 늘 보이지 않는 문장이 하나 붙어 있습니다. 「이 시험지로, 이 채점자가, 이때 재었을 때.」 그 문장을 소리 내어 읽는 순간, 같은 숫자가 다른 크기로 보입니다.


근거 논문

  • "One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling" (2013, 프리프린트) — arXiv:1312.3005 — 진보 측정을 위한 공유 말뭉치 제안, 5-gram 기준선과 조합 기법의 perplexity 감소.
  • "Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks" (2021, 프리프린트) — arXiv:2103.14749 — 10개 데이터셋 테스트셋의 평균 최소 3.3% 라벨 오류, 라벨 교정 시 모델 순위 역전.
  • "Dynabench: Rethinking Benchmarking in NLP" (2021, 프리프린트) — arXiv:2104.14337 — 사람·모델을 고리에 넣는 동적 데이터셋 생성 플랫폼.
  • "The Great Misalignment Problem in Human Evaluation of NLP Methods" (2021, 프리프린트) — arXiv:2104.05361 — 문제 정의·방법·사람 평가의 미정렬, 표본 10편 중 완전 정렬 1편.
  • "Augmenting NLP data to counter Annotation Artifacts for NLI Tasks" (2023, 프리프린트) — arXiv:2302.04700 — 모델이 과제를 푸는 대신 데이터셋 아티팩트에 기대는 현상과 증강 기반 교정.
  • "NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark" (2023, 입장문 · EMNLP Findings 게재) — arXiv:2310.18018 — 오염의 정의와 수준 구분, 문제 규모가 알려지지 않았다는 점, 공동체적 측정의 필요.
  • "Rethinking Benchmark and Contamination for Language Models with Rephrased Samples" (2023, 프리프린트) — arXiv:2311.04850 — n-gram 기반 오염 제거의 우회 가능성, 대형 공개 말뭉치에서의 벤치마크 중복, 합성 데이터에서의 오염.
  • "Missing Information, Unresponsive Authors, Experimental Flaws" (2023, 프리프린트) — arXiv:2305.01633 — 기존 사람 평가 중 재현 후보가 13%, 선정 실험 대부분의 결함.
  • "MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark" (2024, 프리프린트) — arXiv:2406.01574 — 포화 진단, 선택지 확장과 잡음 문항 제거, 프롬프트 민감도 감소.
  • "Are We Done with MMLU?" (2024, 프리프린트) — arXiv:2406.04127 — 5,700문항 재주석, 전체 오류율 6.49% 추정, 한 부분집합 57%, 원 보고 성능과의 불일치.
  • "Quantifying Variance in Evaluation Benchmarks" (2024, 프리프린트) — arXiv:2406.10229 — 시드 분산·단조성 측정, 과제 형식 변경의 효과와 문항반응이론의 한계.
  • "PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection" (2024, 프리프린트) — arXiv:2406.18326 — 동일 분포 대응물과 확신 비교 검정, 시험한 거의 모든 모델·벤치마크의 오염 의심.
  • "A Critical Review of Causal Reasoning Benchmarks for Large Language Models" (2024, 프리프린트) — arXiv:2407.08029 — 인과추론 벤치마크 다수가 도메인 지식 검색으로 풀릴 가능성.
  • "Towards Data Contamination Detection for Modern Large Language Models: Limitations, Inconsistencies, and Oracle Challenges" (2024, 프리프린트) — arXiv:2409.09927 — 다섯 탐지법 교차 검토, 지시 미세조정 오염 탐지의 어려움, 방법 간 일관성 제한.
  • "Does Data Contamination Detection Work (Well) for LLMs? A Survey and Evaluation on Detection Assumptions" (2024, 프리프린트) — arXiv:2410.18966 — 50편 리뷰와 여덟 가정 범주, 멤버십 추론이 무작위 추측 수준일 수 있음.
  • "MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark" (2024, 프리프린트) — arXiv:2412.15194 — 의도적/비의도적 유출의 분리 대응, 검증셋 공개·테스트셋 비공개 설계.
  • "Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering" (2025, 프리프린트) — arXiv:2502.06193 — 모델 심판이 기존 자동 지표보다 사람 점수와 높은 상관을 보인 과제들.
  • "Recent Advances in Large Language Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation" (2025, 프리프린트) — arXiv:2502.17521 — 정적 강화 방법의 내재적 한계와 동적 벤치마크 평가 기준의 부재.
  • "Position: Don't Use the CLT in LLM Evals With Fewer Than a Few Hundred Datapoints" (2025, 프리프린트) — arXiv:2503.01747 — 소규모 벤치마크에서 중심극한정리 기반 오차 막대의 과소평가와 대안 제안.
  • "Medical Large Language Model Benchmarks Should Prioritize Construct Validity" (2025, 프리프린트) — arXiv:2503.10694 — 면허시험 문항 기반 의료 벤치마크의 구인타당도 격차를 실제 임상 데이터로 검증.
  • "The Benchmarking Epistemology: Construct Validity for Evaluating Machine Learning Models" (2025, 프리프린트) — arXiv:2510.23191 — 벤치마크 점수가 데이터셋 상대적 측정치라는 점과 구인타당도 조건의 명시화, 세 가지 사례 연구.
  • "The Ouroboros of Benchmarking: Reasoning Evaluation in an Era of Saturation" (2025, 프리프린트) — arXiv:2511.01365 — 포화와 대체의 순환, 벤치마크 통과가 곧 추론 능력인가라는 물음.
  • "Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks" (2025, 프리프린트) — arXiv:2511.04689 — 문항반응이론 기반 적응형 검사, 문항 수 대폭 감소와 정확도 동일 대상의 능력 분화.
  • "Measuring what Matters: Construct Validity in Large Language Model Benchmarks" (2025, 프리프린트) — arXiv:2511.04703 — 29명 검토자, 445개 벤치마크 체계적 리뷰, 타당성을 훼손하는 패턴과 여덟 권고.
  • "What Are We Measuring in NLG? A Meta-Analysis of Evaluation Trends 2020-2025" (2026, 프리프린트) — arXiv:2601.07648 — 지표 관성·지표-기준 대응 문제·검증 격차(사람 검증 8% 미만).
  • "When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation" (2026, 프리프린트) — arXiv:2602.16763 — 60개 벤치마크 분석, 약 절반이 포화, 전문가 큐레이션이 내성에 기여.
  • "Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks" (2026, 프리프린트) — arXiv:2605.11209 — 포화가 가리는 신뢰성 축, 정확도가 같아도 추정 실패율이 크게 다를 수 있음.
  • "Reliability without Validity: A Systematic, Large-Scale Evaluation of LLM-as-a-Judge Models" (2026, 프리프린트) — arXiv:2606.19544 — 약 54만 건 판정, 카파 감쇠·순위 이동·일관성–편향 역설.
  • "Position: Evaluation Scores Are Perishable Knowledge Claims" (2026, 프리프린트) — arXiv:2607.26191 — 신뢰 팽창, 형식성·범위·타당 기간, 평균 합산과 최약 신호 합산의 상위권 불일치.
📚 인공지능과 언어모델 1부 — 말하는 기계를 재는 법
6 / 6
  1. 1.역전파에서 알파폴드까지 — 딥러닝은 무엇을 딛고 올라섰나
  2. 2.다음 낱말을 맞히는 훈련이 어떻게 대화가 되는가 — 언어모델을 읽기 위한 최소 토대
  3. 3.LLM은 왜 '거짓말'을 하는가 — 환각은 어디서 생기고, 줄이는 방법은 어디까지 듣는가
  4. 4.AI는 정말 '생각'하는가 — 아직 학계가 다투는 중인 질문
  5. 5.프롬프트가 진짜 효과 있나 — AI에게 잘 묻는 법의 과학
  6. 6.점수는 올랐다. 그런데 무엇이 올랐나
← 이전 글프롬프트가 진짜 효과 있나 — AI에게 잘 묻는 법의 과학

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.