Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

AI의 오류 — 시험장 밖에서 틀리는 수험생

AI는 여러 방식으로 틀리고, 시험 점수가 실력을 부풀리기도 한다. 그럴듯하지만 틀린 말을 만들어 내는 환각, 한쪽으로 기운 결과를 되풀이하는 편향, 배운 것과 다른 상황에서 무너지는 분포 이동과 지름길 학습, 일부러 속이는 적대적 예제, 시험지가 새어 나간 벤치마크 오염까지 — 종류마다 어디를 확인해야 하는지 배경지식 없이 따라간다.

🌱첫걸음✦AI 생성컴퓨터과학·AI · 2026년 10월 3일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

AI의 오류 — 시험장 밖에서 틀리는 수험생

백 점짜리 답안이 낯선 사진 앞에서 무너질 때

코로나19가 번지던 무렵, 가슴 X선 사진 한 장으로 감염을 가려내는 AI가 여럿 나왔습니다. 감염된 사람을 하나도 놓치지 않았다는 결과, 곧 100%를 보고한 것까지 있었습니다. 전문의보다 훨씬 잘 맞힌다는 숫자였습니다 (PMID 34660166).

그런데 이 AI들이 사진의 어느 부분에 기대어 답을 냈는지 설명 기법으로 들여다보면 이상한 장면이 나옵니다. 답을 정하는 데 가장 크게 쓰인 자리가 폐 바깥에 있었습니다. 폐의 감염을 가리는 데 폐 바깥이 답을 좌우한다는 것은 있을 법하지 않은 일입니다. 만들 때 쓰지 않은 다른 곳의 사진으로 다시 시험하자 성능은 크게 떨어졌습니다 (PMID 34660166).

인공지능은 사람이 지능을 써서 하던 일을 컴퓨터가 해내게 하려는 기술을 두루 부르는 말입니다. 줄여서 AI라고 부릅니다. 이 X선 AI들은 이 시리즈의 다른 편에 나온 기출문제집 수험생을 떠올리게 합니다. 그 편에서는 따로 떼어 둔 시험 문제로 문제집만 외운 수험생을 가려냈습니다. 그런데 그 시험 문제도 같은 문제집에서 나왔습니다. 이 글은 그 시험까지 통과한 수험생이 시험장 밖으로 나섰을 때 겪는 일을 따라갑니다.

틀림은 몇 갈래로 나뉩니다. 그럴듯하지만 틀린 말을 만들어 내는 틀림, 한쪽으로 기운 결과를 되풀이하는 틀림, 배운 것과 다른 상황에서 무너지는 틀림, 누군가 일부러 속이려 들 때의 틀림입니다. 여기에 시험 점수가 실력보다 부풀려지는 문제가 하나 더 붙습니다.

AI는 여러 방식으로 틀리고, 방식마다 확인하는 방법이 다릅니다. 수험생 비유는 시험과 채점의 구조를 옮길 뿐이고, AI가 무언가를 이해하는지는 이 글도 판정하지 않습니다.

예시에서 답하는 방식을 찾는 기계

사진 속 고양이를 알아보는 프로그램을 만든다고 해 봅시다. 귀가 뾰족하고 수염이 있으면 고양이라는 식으로 규칙을 적어 넣을 수도 있지만, 예외가 끝없이 나옵니다. 오늘날 AI의 주력은 다른 길을 걷습니다. 머신러닝은 사람이 규칙을 하나하나 적어 넣는 대신, 컴퓨터가 예시 데이터나 경험에서 입력을 처리하는 방식을 스스로 찾아내게 하는 방법입니다.

모델은 입력을 받아 출력을 내는 계산 장치로, 그 안의 숫자들을 조정해 원하는 답에 가깝게 만들 수 있습니다. 학습은 예시 데이터나 경험에 맞춰 모델 안의 숫자들을 조금씩 고쳐 가는 과정으로, 훈련이라고도 부릅니다. 고양이 사진과 「고양이」라는 이름표를 수없이 보여 주며 학습시키면, 모델은 그 예시들에 맞춰 사진을 처리하는 방식을 스스로 찾아냅니다. 그렇게 찾아낸 방식은 모델 안의 숫자들에 담기고, 사람이 읽는 규칙 목록의 꼴을 띠지 않습니다.

이 글에 나오는 틀림 가운데 여럿이 여기서 시작됩니다. 모델이 입력을 처리하는 방식은 주로 예시에서 오고, 모델의 구조와 학습 방법도 함께 정합니다. 그래서 예시에 없던 것, 예시에 한쪽으로 몰려 담긴 것, 예시에서 우연히 정답과 겹친 것이 그 방식에 스며들 수 있습니다. 외운 것과 제대로 배운 것이 어떻게 갈리는지는 이 시리즈의 다른 편 「AI 모델」가 다룹니다. 이 글은 그다음, 배운 방식이 틀리는 자리를 봅니다.

모르는 문제에도 답을 쓴다

표에 담긴 데이터를 읽고 그 내용을 글로 옮기는 과제가 있습니다. 누구나 내려받아 쓸 수 있는 공개 모델 셋(Llama 2, Mistral, Zephyr)에게 이 일을 맡기자, 글은 매끄럽고 앞뒤도 맞았습니다. 그런데 사람 평가자로 보나 자동 채점으로 보나, 출력의 80% 넘게에서 뜻이 틀린 곳이 적어도 한 군데 나왔습니다 (DOI: 10.18653/v1/2024.acl-long.651, 2024년).

환각은 AI가 그럴듯하게 들리지만 사실과 다르거나 주어진 자료와 어긋나는 내용을 만들어 내는 일입니다. 환각은 몇 갈래로 나뉩니다. 사용자가 준 글과 어긋나는 것, 자기가 앞에서 한 말과 모순되는 것, 세상에 알려진 사실과 어긋나는 것입니다 (DOI: 10.1162/coli.a.16). 임상 쪽에서 보고된 실패에는 지어낸 인용도 들어 있습니다 (PMID 42251377). 문장이 매끄럽다는 것은 내용이 맞다는 신호가 되지 못합니다.

챗봇 뒤의 모델은 앞에 나온 말을 보고 다음에 올 말을 확률로 골라 이어 붙이며 글을 만듭니다. 그 방식은 이 시리즈의 다른 편 「생성형 AI의 대답」이 다룹니다. 여기서는 환각이 어디서 오는지에 대한 설명 둘만 봅니다.

첫째 설명은 학습 데이터와 질문 쪽에 있습니다. 방대한 온라인 글로 학습한 모델은 말은 유창하지만, 학습 데이터의 치우침을 따라 정보를 넘겨짚거나, 모호한 질문을 잘못 읽거나, 겉으로만 질문에 맞도록 정보를 바꿀 수 있습니다 (DOI: 10.48550/arxiv.2401.01313, 동료심사를 거치지 않은 프리프린트).

둘째 설명은 시험과 닮았습니다. 2025년의 한 논문(동료심사를 거치지 않은 프리프린트)은 어려운 시험 문제 앞의 수험생처럼, 챗봇 뒤의 모델도 확실하지 않을 때 때로 찍는다고 봅니다. 모른다고 하는 대신 그럴듯하지만 틀린 문장을 내놓는다는 것입니다 (arXiv:2509.04664v1).

이 프리프린트는 환각이 생기는 까닭과 남는 까닭을 나눕니다. 먼저, 방대한 글로 미리 학습하는 단계에서 모델이 틀린 문장을 사실과 가려내지 못하면, 환각은 참과 거짓을 가르는 판정의 오류에서 비롯되어 통계적으로 자연스럽게 생긴다고 봅니다. 다음으로, 대부분의 평가가 「모르겠다」처럼 확실하지 않다고 밝힌 답에는 점수를 주지 않아, 확실하지 않을 때도 찍는 편이 점수를 올리기 때문에 환각이 사라지지 않고 남는다고 주장합니다 (arXiv:2509.04664v1).

그럼 환각은 고쳐질까요. 줄이는 기법은 32가지가 넘게 정리되어 있습니다 (DOI: 10.48550/arxiv.2401.01313). 의료용 AI를 평가한 연구 44편을 모아 보니, 관련 문서를 먼저 찾아 눈앞에 놓아 주는 방식은 환각을 30~50% 줄였습니다. 줄였을 뿐 없앤 것은 아닙니다. 사람이 중간에 확인하는 단계를 넣은 방식은 최대 95%까지 줄였지만 규모를 키우기 어렵다는 우려가 따랐습니다 (PMID 42251377).

앞의 프리프린트 저자들은 새 환각 시험을 더 만드는 대신 순위표를 좌우하는 기존 시험들의 채점 방식을 고치자고 제안합니다. 환각이 남는 쪽을 겨냥한 처방입니다 (arXiv:2509.04664v1). 환각은 여러 방법으로 줄어들지만, 앞의 프리프린트에 따르면 가장 앞선 시스템에도 남아 있습니다 (arXiv:2509.04664v1).

한쪽으로 기운 문제집

독일의 한 대학에서 학생 304명에게 물었더니, 학생들은 대학 안의 결정을 사람이 내릴 때보다 알고리즘이 내릴 때를 절차에서도 결과에서도 더 공정하다고 평가했습니다 (DOI: 10.1145/3351095.3372867). 같은 논문이 정리한 비판은 반대 방향을 가리킵니다. 알고리즘은 객관적이고 공정한 결정자가 되기보다, 학습 데이터에 이미 있던 치우침을 되풀이할 수 있다는 것입니다.

편향은 AI가 특정 집단이나 상황에 대해 한쪽으로 기운 결과를 되풀이하거나 키우는 성질로, 흔히 학습 데이터의 치우침에서 오지만 무엇을 정답으로 삼는지나 어떻게 평가하고 쓰는지에서도 생깁니다. 편향이 들어오는 길로는 대표성 없는 데이터, 틀린 이름표, 정답 대신 쓴 그럴듯하지만 치우친 대리 지표, 사람과 AI가 주고받는 방식까지 여럿이 꼽힙니다 (PMID 42466917).

그중 데이터 쪽을 보면, 사회에 관한 데이터는 소수 집단을 충분히 담지 못하는 일이 흔합니다. 그 까닭은 과거의 차별부터 데이터를 모으고 고르는 방식의 치우침까지 여럿입니다. 「치우친 것이 들어가면 치우친 것이 나온다」는 말이 여기서 나옵니다 (DOI: 10.1145/3588433). 모으는 방식 자체가 치우쳐 있다면, 같은 방식으로 더 모은 데이터도 같은 치우침을 담습니다. 데이터의 양이 편향을 저절로 지워 주지는 않습니다.

가상의 예를 하나 들어 봅시다. 한 회사가 지난 십 년의 채용 기록으로 서류 심사 모델을 학습시킨다고 합시다. 그 기록에 어떤 집단이 적게 뽑혀 온 흔적이 있다면, 모델은 그 흔적도 「합격하는 지원서의 특징」으로 함께 배울 수 있습니다. 한쪽으로 기운 문제집으로만 공부한 수험생이 그 기울기까지 정답으로 익히는 것과 같습니다.

편향은 평균 점수 뒤에 숨기도 합니다. 앞의 가상 채용 모델이라면, 적게 뽑혀 온 집단은 학습 예시도 적어 그 집단의 지원서에서 더 자주 틀릴 수 있습니다. 게다가 정답으로 쓴 과거 결정 자체가 치우쳐 있었다면, 그 정답에 견준 정확도로는 치우침이 드러나지도 않습니다.

실제 사례도 있습니다. 소아 응급실에서 환자의 위급도를 가르는 AI는 전체로는 높은 정확도를 보였지만, 아이들의 하위 집단마다 성능이 달랐습니다. 이 근거에는 긍정적인 결과가 더 많이 발표되는 치우침도 섞여 있습니다 (PMID 42137483). 평균이 높아도 어떤 집단에서는 더 자주 틀릴 수 있고, 집단별로 나눠 보기 전에는 그 격차가 잘 보이지 않습니다 (PMID 42466917).

맞힌 비율 막대그래프. 전체와 집단 A·B의 막대는 전체 평균선 근처로 높지만, 집단 C의 막대는 그보다 눈에 띄게 낮다.

줄이는 방법은 여럿 나와 있습니다. 데이터를 손보는 단계, 학습하는 단계, 나온 결과를 고치는 단계에 걸친 방법들이 341편의 논문으로 정리되어 있습니다 (DOI: 10.1145/3631326).

다만 무엇을 공정하다고 볼지부터 정의가 여럿이고 (DOI: 10.1145/3457607), 의료 AI를 다룬 한 종설은 공정함이 지표 하나나 한 번의 검증으로 보장되지 않으며 쓰는 동안 계속 지켜봐야 한다고 결론짓습니다 (PMID 42466917).

문제집 밖의 문제

스팸 메일을 거르는 프로그램은 자기가 배운 스팸과 생김새가 다른 스팸을 알아보지 못할 수 있습니다 (DOI: 10.7551/mitpress/9780262170055.001.0001). 스팸의 모양이 바뀌면, 어제까지 걸러지던 종류의 메일이 오늘은 받은편지함으로 들어올 수 있습니다.

분포 이동은 모델이 학습할 때 본 데이터와 실제로 쓰일 때 만나는 데이터가 나오는 분포가 서로 달라지는 일로, 어떤 입력이 얼마나 자주 나오는지가 바뀔 수도 있고 입력과 정답의 관계가 바뀔 수도 있습니다. 여기서 분포는 어떤 입력이 어떤 정답과 함께 얼마나 자주 나오는지를 뜻합니다. 스팸 필터라면 스팸의 생김새가 바뀌는 것도, 무엇을 스팸으로 볼지가 바뀌는 것도 분포 이동입니다.

데이터셋 이동이라고도 부르고, 실제 응용 대부분에서 나타납니다. 원인은 실험 설계가 들여온 치우침부터, 쓰일 때의 조건을 학습 때 미리 똑같이 만들어 둘 수 없는 사정까지 다양합니다 (DOI: 10.7551/mitpress/9780262170055.001.0001). 세상이 바뀌지 않아도, 다른 곳에서 모은 데이터만으로 생길 수 있다는 뜻입니다. 맨 처음의 X선 AI의 성능이 크게 떨어진 것도 다른 곳의 사진 앞이었습니다.

기존의 머신러닝 방법은 이런 변화를 잘 다루지 못하는 일이 많고, 이런 변화는 성능을 크게 떨어뜨릴 수 있습니다. 학습 때와 쓸 때의 차이를 줄이는 방법도 연구되어 있습니다. 아주 단순한 방법 하나가 표준 시험에서 뛰어난 결과를 내기도 했습니다 (DOI: 10.1609/aaai.v30i1.10306). 문제집 안의 문제만 풀어 본 수험생이 시험장 밖의 문제를 만난 것과 같습니다.

모델은 자기가 낯선 상황에 서 있다는 사실을 늘 알려 주지는 못합니다. 모델이 자기 답을 얼마나 확신하는지 나타내는 값을 다듬는 흔한 방법들은 분포가 바뀐 데이터 앞에서 모자랐고, 여러 모델의 답을 함께 따지는 방법 일부는 뜻밖에 잘 버텼습니다 (DOI: 10.48550/arxiv.1906.02530, arXiv에 공개된 프리프린트 판).

분포 이동 앞에서 모델이 무너질 때, 그 뒤에서 자주 거론되는 까닭이 있습니다. 지름길 학습은 모델이 익숙한 시험에서는 잘 맞지만 더 까다로운 조건이나 실제 현장으로는 옮겨 가지 못하는 손쉬운 판단 규칙을 익히는 일입니다. 여기서 규칙은 사람이 읽는 목록을 뜻하지 않고, 모델이 실제로 답을 가르는 방식을 가리킵니다. 지름길은 평소 시험에서는 드러나지 않다가, 조건이 바뀌는 자리에서 드러납니다 (arXiv:2004.07780v5, arXiv에 공개된 프리프린트 판).

문제의 뜻을 읽는 대신 보기의 길이나 번호 모양으로 정답을 고르는 요령을 익힌 수험생을 떠올리면 됩니다. 비슷한 현상이 교육학과 비교심리학에도 알려져 있어, 지름길 학습은 생물이든 기계든 배우는 시스템에 두루 나타나는 성질일 수 있습니다 (arXiv:2004.07780v5).

맨 처음의 X선 AI로 돌아가 봅시다. 폐 바깥에 기대어 답을 낸 모델, 다른 곳의 사진에서 성능이 크게 떨어진 모델은 지름길 학습의 모습과 겹칩니다. 2021년까지의 연구를 모은 저자들은 그 모델들이 지름길 학습에 빠진 경우가 많아 진료 현장에 쓰기엔 덜 적합하다고 결론지었습니다 (PMID 34660166). 시험에서 통한 방식이 현장에서도 통한다는 보장은 없습니다.

두 칸. 왼쪽은 시험장에서 동그라미 표시가 된 답안을 내는 수험생, 오른쪽은 같은 수험생이 낯선 거리에서 처음 보는 기계 앞에 문제집을 쥔 채 당황해 서 있는 모습이다.

사람 눈엔 같은 시험지

사진을 알아보는 모델에게 사진 한 장을 보여 주되, 사람 눈으로는 알아챌 수 없을 만큼 작은 변화를 더하면 모델이 그 사진을 엉뚱한 것으로 분류하게 만들 수 있습니다. 그 변화는 아무렇게나 뿌린 잡음과 다릅니다. 모델의 오답이 가장 커지도록 찾아낸 변화입니다. 같은 변화가 같은 데이터의 다른 부분으로 학습한 다른 모델까지 속이기도 했습니다 (arXiv:1312.6199v4, 2013년 arXiv에 공개된 프리프린트 판).

적대적 예제는 사람 눈에는 거의 달라 보이지 않지만, 모델이 틀리도록 일부러 골라 아주 조금 바꾼 입력입니다. 이런 입력 앞에서 모델은 틀린 답을 높은 확신과 함께 내놓기도 합니다 (DOI: 10.48550/arxiv.1412.6572, arXiv에 공개된 프리프린트 판).

분포 이동은 누가 노리지 않아도 생길 수 있는 반면, 적대적 예제는 누군가 특정 모델이 틀리도록 입력 하나하나를 골라 조금씩 고친 것입니다. 시험지 전체에 사람 눈엔 보이지 않을 만큼 옅은 얼룩을 골라 찍어, 수험생을 헷갈리게 하는 것과 비슷합니다. 필터를 피하려고 수법을 바꾸는 스팸처럼, 상대가 일부러 일으키는 분포 이동도 있습니다. 둘을 가르는 것은 노림의 유무보다, 데이터 전체가 달라졌는지 입력 하나하나를 특정 모델에 맞춰 고쳤는지입니다.

막는 연구도 나아갔습니다. 가장 나쁜 경우의 공격을 가정하고 학습시키는 방법은 여러 종류의 공격에 대한 저항을 크게 높였습니다 (DOI: 10.48550/arxiv.1706.06083, arXiv에 공개된 프리프린트 판).

그러나 다른 방어들은 쉽게 뚫렸습니다. 2017년의 연구들에서 적대적 예제를 가려내겠다던 제안 열 가지가 새 방식의 공격에 모두 뚫렸고 (DOI: 10.1145/3128572.3140444), 공격 성공률을 95%에서 0.5%로 낮췄다던 방어도 새 공격 세 가지 앞에서는 그 방어를 쓴 모델과 안 쓴 모델이 똑같이 뚫렸습니다 (DOI: 10.1109/sp.2017.49).

이런 공격이 딥러닝 모델의 타고난 약점일 수 있다는 발견도 소개되지만, 강건하게 학습시키는 방법을 낸 저자들은 잘 정의된 공격에 버티는 힘을 완전히 버티는 모델로 가는 디딤돌로 봅니다 (DOI: 10.48550/arxiv.1706.06083). 누군가 일부러 속이려 드는 자리에서는 평소의 정확도가 안전을 말해 주지 않습니다.

시험지를 미리 본 수험생

초등학교 수준의 산수 문제로 AI의 수학 문제 풀이 실력을 재는 표준 시험이 있습니다. 사람이 푸는 비율, 풀이 단계 수, 답의 크기까지 이 시험과 맞춘 새 문제 1,000개를 따로 만들어 앞선 모델들에게 풀게 하자, 정답률이 최대 8% 떨어졌습니다 (DOI: 10.48550/arxiv.2405.00332, 2024년 arXiv에 공개된 프리프린트 판).

벤치마크는 여러 AI 모델에게 같은 문제를 풀게 해 점수를 견주도록 만들어 둔 시험 문제 모음으로, 대개 공개되어 있습니다. 챗봇 뒤의 모델이 뛰어나다는 말은 대개 이런 공개 벤치마크의 점수로 뒷받침됩니다 (DOI: 10.18653/v1/2024.findings-acl.716). 문제는 공개된 시험지가 학습 데이터로 흘러들 수 있다는 데 있습니다.

벤치마크 오염은 시험 문제나 그와 아주 비슷한 글이 모델의 학습 데이터에 미리 섞여 들어가는 일입니다. 데이터 오염이라고도 부릅니다. 오염된 모델은 그 시험에서 실력보다 높은 점수를 받을 수 있고, 그 때문에 틀린 과학적 결론이 발표될 수도 있습니다. 문제의 규모는 재기가 쉽지 않습니다 (DOI: 10.18653/v1/2023.findings-emnlp.722, 입장문). 학습 데이터가 워낙 크고 공개되지 않는 경우가 많아서입니다 (DOI: 10.18653/v1/2024.findings-acl.716).

밤에 책상에서 두꺼운 학습 자료 더미를 보는 학생. 더미 한가운데에 붉은 테두리 시험지 한 장이 끼어 있고, 같은 시험지가 작은 원 안의 시험장 책상 위에도 놓여 있다.

잰 결과도 있습니다. 모델 15개 이상을 널리 쓰이는 객관식 시험 여섯 개로 살피자, 오염 정도는 시험에 따라 1%에서 45%까지 퍼져 있었습니다. 오염된 시험 가운데 둘에서는 정답률이 각각 최대 14%와 7% 부풀려져 있었고, 또 다른 시험에서는 소폭 오르는 데 그쳤습니다. 오염은 2020년부터 2023년 사이에 빠르게 늘었고, 큰 모델일수록 오염의 덕을 더 봤습니다 (DOI: 10.18653/v1/2024.findings-emnlp.30).

앞의 산수 시험 이야기에는 뒷절이 있습니다. 기존 시험 문제를 그대로 만들어 낼 가능성이 높은 모델일수록 두 시험의 점수 차도 커지는 경향이 있었고, 몇몇 모델 계열은 거의 모든 크기에서 기존 시험에 맞춰진 흔적을 보였습니다. 일부 모델이 기존 시험을 부분적으로 외웠을 수 있다는 뜻입니다.

그러나 가장 앞선 모델들을 비롯한 많은 모델은 그런 흔적이 적었습니다. 학습 데이터에 없을 것이 확실한 새 문제에서도 모든 모델의 점수가 기존 시험에 견주어 대체로 크게 무너지지 않았습니다 (DOI: 10.48550/arxiv.2405.00332). 벤치마크 점수는 그 시험에서 받은 점수일 뿐이고, 처음 보는 문제에서의 실력은 새 문제로 따로 재야 합니다.

채점자를 한 명 더

월요일 아침, 지난주 판매 표를 주고 챗봇에게 회의 자료 초안을 맡겼다고 해 봅시다. 초안은 매끄럽습니다. 2024년에 공개 모델 셋을 시험했을 때도, 표를 글로 옮긴 매끄러운 글이 뜻의 오류를 품은 경우가 많았습니다 (DOI: 10.18653/v1/2024.acl-long.651). 그 비율이 지금 쓰는 챗봇에도 그대로 맞는지는 알 수 없습니다. 그래도 숫자와 출처는 표와 한 줄씩 대조합니다.

회사가 그런 모델을 들여와 지원자나 직원을 평가하는 데 쓴다면, 들여오는 쪽이 할 일이 있습니다. 결과를 집단별로 나눠 보고, 자기 회사 자료로 다시 시험하고, 쓰는 동안 계속 지켜보는 일입니다. 의료 AI의 공정성을 다룬 종설이 기관에 권하는 방법들인데, 사람을 평가하는 다른 자리에도 옮겨 쓸 수 있는 원칙입니다 (PMID 42466917). 높은 벤치마크 점수를 내세우는 모델이라면, 새 문제로 다시 잰 결과가 있는지 봅니다 (DOI: 10.48550/arxiv.2405.00332).

이 확인하는 자리는 실제로 비어 있기도 합니다. 의료 현장의 한 조사를 보면, 2023년 미국병원협회 조사에 답한 병원의 65%가 예측 모델을 썼고, 그 가운데 자기 병원이나 소속 의료 시스템의 데이터로 정확도를 확인한 곳은 61%, 편향을 확인한 곳은 44%에 그쳤습니다 (DOI: 10.1377/hlthaff.2024.00842).

사람 쪽에도 기울기가 있습니다. AI의 답을 지나치게 믿는 쏠림과 경보가 잦아 무뎌지는 현상이 AI와 사람이 함께 일하는 자리의 위험으로 꼽힙니다 (PMID 42466917).

확인이 들어간 설계는 효과를 냈습니다. 글을 만드는 AI를 쓴 의료용 시스템 연구들에서 시스템 안에 사람의 확인 단계를 넣자 환각이 줄었고, 가장 크게 줄어든 경우가 95%였습니다. 다만 규모를 키우기 어렵다는 우려가 따랐고, 여러 방법을 함께 쓴 쪽이 하나만 쓴 쪽보다 대체로 나았습니다. 저자들은 기술 장치와 사람 쪽 안전장치를 함께 써야 한다고 결론짓습니다 (PMID 42251377).

모델들도 외운 것만은 아닙니다. 초등 산수에서는 모델들이 처음 보는 문제에서도 점수가 크게 무너지지 않았습니다 (DOI: 10.48550/arxiv.2405.00332). AI가 틀리는 방식을 알면, 어디를 확인할지도 알게 됩니다. 시험장 밖으로 나선 수험생에게는 틀리는 방식마다 따로 채점할 자리가 필요하고, 그 자리에는 장치도 사람도 들어갑니다.

어디를 더 볼까

  • 환각이 왜 생기는지 한 층 더 깊이: 「LLM은 왜 '거짓말'을 하는가」
  • 관련 문서를 찾아 붙이면 환각이 어디까지 줄어드는지: 「검색을 붙이면 환각이 사라지는가」
  • 벤치마크 점수가 오를 때 실제로 무엇이 올랐는지: 「점수는 올랐다. 그런데 무엇이 올랐나」
  • 채점마저 AI에게 맡길 때 생기는 기울기: 「채점자도 언어모델이다」
  • 모델이 읽는 글에 숨은 문장이 모델을 속이는 일: 「남이 써 둔 문장이 내 지시가 될 때 — 프롬프트 인젝션」
  • 모델이 무언가를 이해하는지를 둘러싼 논쟁: 「AI는 정말 '생각'하는가」
  • 외운 것과 배운 것의 차이: 이 시리즈의 다른 편 「AI 모델」
  • 다음 말을 확률로 골라 대답을 만드는 방식: 이 시리즈의 다른 편 「생성형 AI의 대답」

근거 논문

arXiv에 공개된 프리프린트 판을 인용한 것은 그렇게 표시했다(이후 학회·학술지 게재 여부는 이 목록으로 확인하지 않았다). 첫 판(v1) 하나뿐인 두 편은 동료심사를 거치지 않은 프리프린트로 표시했다.

  • "Current limitations to identify covid-19 using artificial intelligence with chest x-ray imaging (part ii). The shortcut learning problem." (2021, 종설) — PMID 34660166 — 흉부 X선 코로나19 분류 모델은 민감도 100%까지 보고됐으나, 분류에 가장 기여한 영역이 폐 바깥에 있었고 외부 데이터에서 성능이 크게 떨어졌다. 기존 모델은 지름길 학습에 빠진 경우가 많아 임상 사용에 덜 적합하다.
  • "Shortcut Learning in Deep Neural Networks" (2020, arXiv에 공개된 프리프린트 판·관점 논문) — arXiv:2004.07780v5 — 지름길은 표준 벤치마크에선 잘 맞지만 실제 현장 같은 더 어려운 조건으로 옮겨 가지 못하는 판단 규칙. 비교심리학·교육학에도 유사 현상이 있어 학습 시스템 공통 특성일 수 있다.
  • "Beyond Traditional Benchmarks: Analyzing Behaviors of Open LLMs on Data-to-Text Generation" (2024) — DOI: 10.18653/v1/2024.acl-long.651 — 공개 모델(Llama 2·Mistral·Zephyr)은 유창한 글을 쓰지만 출력의 80% 넘게가 의미 오류를 하나 이상 담았다(사람 평가·GPT-4 기반 지표).
  • "Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models" (2025, 서베이) — DOI: 10.1162/coli.a.16 — 환각을 사용자 입력과의 어긋남·앞선 맥락과의 모순·세상 지식과의 불일치로 정리.
  • "Mitigating hallucinations in healthcare AI: a systematic review of evidence-based strategies." (2026, 체계적 문헌고찰) — PMID 42251377 — 44편 분석. 검색 증강은 환각 30~50% 감소, 사람 개입은 최대 95% 감소하나 확장성 우려. 결합 접근(검색+검증)이 단일 방법보다 대체로 나았다. 지어낸 인용 등이 임상 실패 사례. 기술·사람 안전장치의 결합이 필요하다.
  • "A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models" (2024, 동료심사를 거치지 않은 프리프린트) — DOI: 10.48550/arxiv.2401.01313 — 학습 데이터의 편향에서 넘겨짚기·모호한 질문 오독·겉으로 맞추기 등이 환각으로 이어질 수 있다. 완화 기법 32가지 이상 정리.
  • "Why Language Models Hallucinate" (2025, 동료심사를 거치지 않은 프리프린트) — arXiv:2509.04664v1 — 환각은 사전학습에서 틀린 문장을 사실과 가려내지 못할 때 이진 분류 오류처럼 통계적으로 생기고, 평가가 불확실성 인정보다 찍기를 보상해 남는다고 주장. 최신 시스템에서도 지속. 기존 벤치마크의 채점 방식을 고치자고 제안.
  • "Implications of AI (un-)fairness in higher education admissions" (2020) — DOI: 10.1145/3351095.3372867 — 독일 한 대학 학생 304명 설문에서 알고리즘 결정이 사람 결정보다 절차·분배 공정성 모두 높게 평가됨. 알고리즘은 학습 데이터의 편향을 재생산할 수 있다는 비판을 정리.
  • "Representation Bias in Data: A Survey on Identification and Resolution Techniques" (2023, 서베이) — DOI: 10.1145/3588433 — 사회 데이터는 소수 집단을 충분히 대표하지 못하는 일이 많고, 원인은 역사적 차별부터 선택·표집 편향까지. 「bias in, bias out」.
  • "Artificial Intelligence-Driven Triage in Pediatric Emergency Departments: Accuracy, Bias, and Impact on Clinical Outcomes: A Narrative Review." (2026, 서술적 종설) — PMID 42137483 — 높은 전체 정확도에도 소아 하위 집단마다 성능이 다르고, 편향 확대 위험이 충분히 다뤄지지 않았다.
  • "Bias Mitigation for Machine Learning Classifiers: A Comprehensive Survey" (2023, 서베이) — DOI: 10.1145/3631326 — 편향 완화 논문 341편을 전처리·학습 중·후처리로 분류.
  • "A Survey on Bias and Fairness in Machine Learning" (2021, 서베이) — DOI: 10.1145/3457607 — 실제 응용의 편향 사례와 편향의 출처, 공정성 정의의 분류 체계.
  • "Bias and Fairness Across the Healthcare AI Lifecycle: A Clinician-Oriented Review." (2026, 서술적 종설) — PMID 42466917 — 지름길 학습·분포 이동·자동화 편향·경보 피로 등이 불공정의 기전. 하위 집단별 평가 등을 권고. 공정성은 단일 지표·일회성 검증으로 보장되지 않고 지속 감시가 필요하다.
  • "Dataset Shift in Machine Learning" (2008, 편저) — DOI: 10.7551/mitpress/9780262170055.001.0001 — 훈련과 시험의 분포가 다른 데이터셋 이동은 실제 응용 대부분에 있다. 예: 스팸 필터가 배운 것과 형태가 다른 스팸을 못 알아볼 수 있다.
  • "Return of Frustratingly Easy Domain Adaptation" (2016) — DOI: 10.1609/aaai.v30i1.10306 — 기존 머신러닝은 훈련·시험 입력 분포의 변화를 다루지 못하는 일이 많고, 이런 도메인 이동은 성능을 크게 떨어뜨린다. 단순한 방법(CORAL)이 이동을 줄여 표준 벤치마크에서 뛰어난 결과.
  • "Can You Trust Your Model's Uncertainty? Evaluating Predictive Uncertainty Under Dataset Shift" (2019, arXiv에 공개된 프리프린트 판) — DOI: 10.48550/arxiv.1906.02530 — 데이터셋 이동에서 전통적 사후 보정은 모자랐고, 여러 모델을 아우르는 방법 일부는 강했다.
  • "Intriguing properties of neural networks" (2013, arXiv에 공개된 프리프린트 판) — arXiv:1312.6199v4 — 예측 오류를 최대화해 찾은 눈에 띄지 않는 변화로 이미지를 오분류시킬 수 있고, 같은 변화가 다른 부분집합으로 학습한 다른 네트워크도 속인다.
  • "Explaining and Harnessing Adversarial Examples" (2014, arXiv에 공개된 프리프린트 판) — DOI: 10.48550/arxiv.1412.6572 — 작지만 의도적으로 최악인 변화를 준 입력에 모델이 높은 확신으로 오답을 낸다.
  • "Towards Deep Learning Models Resistant to Adversarial Attacks" (2017, arXiv에 공개된 프리프린트 판) — DOI: 10.48550/arxiv.1706.06083 — 강건 최적화로 넓은 범위의 공격에 대한 저항을 크게 높임. 적대적 공격이 딥러닝 모델의 고유한 약점일 수 있다는 최근 발견을 문제로 제기하고, 잘 정의된 공격에 대한 강건성을 완전히 저항하는 모델로 가는 디딤돌로 본다.
  • "Adversarial Examples Are Not Easily Detected" (2017) — DOI: 10.1145/3128572.3140444 — 탐지 제안 10가지가 모두 새 손실 함수로 무력화됐다.
  • "Towards Evaluating the Robustness of Neural Networks" (2017) — DOI: 10.1109/sp.2017.49 — 공격 성공률을 95%에서 0.5%로 낮췄다던 방어적 증류가 새 공격 세 가지 앞에서 강건성을 크게 높이지 못했다(증류·비증류 모두 100% 돌파).
  • "A Careful Examination of Large Language Model Performance on Grade School Arithmetic" (2024, arXiv에 공개된 프리프린트 판) — DOI: 10.48550/arxiv.2405.00332 — GSM8k와 맞춘 새 문제 GSM1k에서 정확도 최대 8% 하락, 일부 모델 계열에 체계적 과적합 흔적. 그러나 최전선 모델은 흔적이 적고 모든 모델이 새 문제에 대체로 일반화했다.
  • "Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models" (2024) — DOI: 10.18653/v1/2024.findings-acl.716 — LLM 성능 주장은 공개 벤치마크로 뒷받침되는데, 거대하고 불투명한 학습 데이터 때문에 오염 탐지가 어렵다.
  • "NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark" (2023, 입장문) — DOI: 10.18653/v1/2023.findings-emnlp.722 — 오염은 성능을 과대평가하게 하고 잘못된 과학적 결론을 낳을 수 있으며, 규모는 측정이 쉽지 않다.
  • "An Open-Source Data Contamination Report for Large Language Models" (2024) — DOI: 10.18653/v1/2024.findings-emnlp.30 — 15개 이상 모델·6개 객관식 벤치마크에서 오염 1~45%, C-Eval·HellaSwag 정확도 최대 14%·7% 부풀림, MMLU는 소폭. 2020~2023 급증, 큰 모델일수록 이득이 큼.
  • "Current Use And Evaluation Of Artificial Intelligence And Predictive Models In US Hospitals" (2025) — DOI: 10.1377/hlthaff.2024.00842 — 2023년 미국 병원 65%가 예측 모델 사용, 그중 61%가 자체 데이터로 정확도 평가, 편향 평가는 44%.
📚 AI 첫걸음 — 예시에서 배우고, 이어 붙이고, 틀리는 계산
4 / 4
  1. 1.AI 모델 — 규칙 대신 예시에서 배우는 계산
  2. 2.신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것
  3. 3.생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장
  4. 4.AI의 오류 — 시험장 밖에서 틀리는 수험생
← 이전 글생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.