
Paperis 아티클
LLM은 왜 '거짓말'을 하는가 — 환각은 어디서 생기고, 줄이는 방법은 어디까지 듣는가
AI가 그럴듯하게 틀리는 까닭을 「AI의 오류」보다 한 층 더 깊이, 2023~2026년의 논문으로 따라갑니다.
LLM은 왜 '거짓말'을 하는가 — 환각은 어디서 생기고, 줄이는 방법은 어디까지 듣는가
챗봇에게 어떤 책의 줄거리를 물었더니 존재하지 않는 인물과 있지도 않은 결말을 술술 읊습니다. 논문을 요약시켰더니 멀쩡해 보이는 인용을 달았는데, 그 논문은 세상에 없습니다. 사람들은 이것을 「AI가 거짓말한다」고 부르고, 연구자들은 환각(hallucination)이라고 부릅니다. 「AI의 오류 — 시험장 밖에서 틀리는 수험생」의 정의로, 환각은 AI가 그럴듯하게 들리지만 사실과 다르거나 주어진 자료와 어긋나는 내용을 만들어 내는 일입니다.
「AI의 오류」가 소개한 설명 하나는 시험장의 수험생에 빗댑니다. 언어 모델도 확실하지 않을 때 때로 모른다고 하는 대신 그럴듯한 답을 찍는다는 것입니다. 이 설명을 내놓은 2025년의 프리프린트에 따르면, 환각은 참과 거짓을 가려내지 못하는 한 통계적으로 생기고, 대부분의 평가가 「모르겠다」에 점수를 주지 않아 사라지지 않고 남습니다 (arXiv:2509.04664, 동료심사를 거치지 않은 프리프린트).
이 글은 한 층 더 내려가, 환각이 지식과 어떻게 함께 나타나는지, 줄이는 방법이 어디까지 듣는지, 모델을 키우면 나아지는지를 봅니다. 2025년에 나온 프리프린트 몇 편을 따라가 보면 답은 한 방향을 가리킵니다 (arXiv:2503.21676; arXiv:2509.04664; arXiv:2509.21473). 환각은 이 기계가 작동하는 방식에서 자연스럽게 따라 나오는 부산물에 가깝습니다.
지식이 생길 때 환각도 함께 나타난다
「생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장」이 따라간 대로, 챗봇 속 언어 모델은 앞에 놓인 토큰들을 보고 다음 토큰의 후보마다 확률을 매긴 뒤 하나를 골라 붙이는 일을 되풀이해 대답을 만듭니다. 토큰은 언어 모델이 글을 잘라 다루는 단위입니다. 이 걸음 어디에도 저장된 사실을 찾아 맞는지 확인하는 단계는 없습니다. 그래서 문법은 매끄럽고 사실은 틀린 문장이 자연스럽게 만들어집니다.
사실 지식과 환각이 학습하는 동안 함께 나타난다는 관찰이 있습니다. 인위적으로 만든 사실 회상 과제로 언어 모델이 사실을 익혀 가는 과정을 따라간 한 프리프린트에서, 환각은 지식과 같은 시점에 나타났습니다 (arXiv:2503.21676). 모델이 사실을 익히는 과정과 환각이 나타나는 과정을 시점으로 떼어 놓기 어렵다는 뜻입니다.
다른 프리프린트는 모델의 답을 데이터에서 짐작해 낸 추정값으로 보고, 환각을 그 추정값을 그럴듯한 어떤 원인에도 잇지 못한 실패로 다시 정의합니다. 수학으로 다루려고 좁힌, 이 연구만의 정의입니다. 그 틀에서 저자들은 손실, 곧 모델의 답이 정답에서 벗어난 정도를 가장 작게 줄인 최적의 추정기조차 여전히 환각한다는 것을 보였습니다. 일반적인 데이터 분포에서 환각률의 확률적 아래 한계도 제시했습니다 (arXiv:2509.21473). 이 틀 안에서는 학습을 아무리 잘 시켜도 환각이 일정 비율 밑으로 내려가지 않는다는 뜻입니다.
「거짓말」이라는 말을 점검한다
「AI가 거짓말한다」「AI가 우리를 속인다」는 표현은 의인화, 곧 사람의 마음과 의도를 기계에 빗대어 붙이는 말입니다. 거짓말은 진실을 알면서 숨기려는 의도를 전제합니다. 확률로 다음 토큰을 고르는 작동 방식, 찍기를 보상하는 채점, 최적의 추정기에도 남는 환각 — 앞의 설명 어디에도 의도가 들어갈 자리는 없습니다. 앞의 설명들로 환각을 풀어내는 데 의도는 필요하지 않습니다.
AI의 기만(deception)을 다루는 연구도 있습니다. 2024년의 한 논평은 큰 언어 모델의 기만적 행동을 다룬 문헌을 전략적 기만, 모방, 아첨, 불성실한 추론의 네 유형으로 정리하고, 이런 행동 밑에 여러 겹의 편향이 깔려 있다고 봅니다 (arXiv:2403.09676). 아첨은 상대가 듣기 좋아할 쪽으로 답을 맞추는 행동이고, 불성실한 추론은 모델이 내놓은 추론 과정이 실제로 답이 나온 과정과 어긋나는 일입니다. 이런 행동이 사람의 거짓말과 같은 것인지, 생각이나 의도 같은 말을 이 기계에 붙일 수 있는지를 둘러싼 논쟁은 「AI는 정말 '생각'하는가 — 아직 학계가 다투는 중인 질문」이 다룹니다.
수어 영상을 글로 옮기는 모델의 환각을 분석한 2025년의 프리프린트는, 모델이 실제 입력인 영상에 근거하기보다 언어적 사전확률에 기댈 때 환각이 생긴다고 봅니다 (arXiv:2510.18439). 언어적 사전확률은 입력을 보지 않고도 평소 말이 흘러가던 방식만으로 다음 말을 짐작하게 하는 쏠림입니다. 이 그림에서 모델은 영상을 덜 보고, 익숙한 말로 빈칸을 메웁니다.
환각의 두 갈래, 탐지의 두 갈래
「AI의 오류」는 환각을 사용자가 준 글과 어긋나는 것, 자기가 앞에서 한 말과 모순되는 것, 세상에 알려진 사실과 어긋나는 것의 셋으로 나눴습니다. 탐지 연구는 흔히 주어진 근거를 잣대로 삼아 둘로 나눕니다. 내재적 환각은 주어진 입력이나 근거와 모순되는 환각이고, 외재적 환각은 주어진 근거로는 확인할 수 없는 내용을 지어낸 환각입니다 (arXiv:2511.10837). 영상을 보고 답하는 모델들에게 같은 문제를 풀게 해 점수를 견주는 시험 문제 모음, 곧 벤치마크 하나도 같은 두 갈래 위에 객체 사이의 관계, 시간, 세부 의미 같은 하위 유형을 더합니다 (arXiv:2406.16338).
이 구분이 쓸모 있는 것은 탐지 기법마다 잘 듣는 갈래가 다르기 때문입니다. 의미 엔트로피는 같은 질문에 답을 여러 번 뽑아 그 뜻이 서로 얼마나 갈리는지 잰 값입니다. 이 방식은 외재적 환각을 잘 잡았지만 내재적 환각에서는 대체로 실패했습니다. 반대로 입력 토큰에 쏠린 어텐션을 모아 보는 방식은 내재적 환각에 더 맞았습니다 (arXiv:2511.10837). 어텐션은 모델이 입력의 어느 부분에 얼마나 주목할지 계산하는 장치입니다. 걱정하는 환각에 따라 골라야 할 탐지기가 다르다는 뜻입니다.

줄이는 방법 셋, 그리고 그 한계
환각을 없애기 어렵다면 관건은 다루는 법이고, 접근은 크게 셋입니다. 검색으로 근거를 붙이기, 답을 검증하기, 구조화된 지식에 묶기입니다.
검색증강. 검색증강 생성(RAG)은 답하기 전에 외부 문서를 찾아 모델 앞에 놓고, 그 문서를 근거로 답하게 하는 방식입니다. RAG는 환각과 지식 노후화를 덜어 주지만, 흩어진 여러 출처를 종합해야 하는 다단계 질문에서는 기존 방식이 자주 흔들립니다. 증거의 빈 곳을 명시적으로 찾아 메우는 일을 되풀이하는 구조를 제안한 2025년의 프리프린트는, 여러 문서를 이어 답해야 하는 질문 모음인 HotpotQA에서 정답과 겹치는 정도를 잰 점수(F1)를 가장 강한 반복형 기준선보다 8.3점 올렸다고 보고합니다 (arXiv:2510.22344). 답의 정확도가 오른 것이고, 환각이 없어졌다는 뜻은 아닙니다. 어텐션의 흐름을 따져 환각에 취약한 토큰의 영향을 줄이는 기법을 더한 2026년의 프리프린트는, 표준 벤치마크에서 기준이 된 RAG 모델보다 환각률을 27.8% 줄였다고 보고했습니다 (arXiv:2604.04020). 특정 벤치마크에서 나온 단일 프리프린트의 결과입니다. 검색을 붙여도 남는 문제는 「검색을 붙이면 환각이 사라지는가」에서 이어집니다.
검증. 모델이 자기가 낸 답의 사실 여부를 스스로 판정하게 하고 그 판정으로 모델을 다시 학습시키는 자기 정렬은, Llama 계열 모델에서 지식이 많이 필요한 세 가지 과제의 사실 정확도를 크게 끌어올렸다고 보고됩니다 (arXiv:2402.09267). 검색해 온 문서에 비추어 작은 모델 여러 개가 답을 문장 단위로 교차 검증하는 방식은, 질문·답·문맥 100여 세트로 검증한 결과 옳은 응답과 환각을 가려내는 F1을 10% 개선했다고 보고합니다 (arXiv:2506.22486). 의미 엔트로피처럼 답을 여러 번 뽑아 일치도를 보는 방식은 표본을 많이 뽑아야 해서 비용이 큽니다. 불확실성에 따라 표본 수를 조절하는 2026년의 프리프린트 기법은, 예산이 적은 조건에서 표본을 절반가량만 쓰고도 기존 방법과 비슷한 탐지 성능을 냈고, 같은 예산에서는 탐지 성능 지표(AUROC)를 평균 12.6% 끌어올렸습니다 (arXiv:2603.22812).
탐지기는 분야를 옮기면 다시 확인해야 합니다. 환자와 의사의 대화를 요약하는 일에서 일반 분야용 환각 탐지기는 임상 환각을 잘 잡지 못했습니다. 원문에서 사실을 일부러 빼서 만든 환각에서의 성능은, 요약하다 자연스럽게 생긴 환각에서의 성능을 믿을 만하게 예측하지 못했습니다. 다만 저자들이 바로 그렇게 만든 환각으로 개발한 의료 전용 탐지기는 실제 임상 환각에도 잘 들었습니다 (arXiv:2506.00448). 탐지기의 성능은 만든 환각에서 잰 점수만으로 판단하기 어렵고, 실제로 생긴 환각에서 따로 확인해야 한다는 뜻입니다.
구조화된 지식에 묶기. 지식 그래프는 위키백과처럼 사실을 명시적으로 담아 둔 구조화된 지식 저장소입니다 (arXiv:2306.08302). 답을 지식 그래프에 맞춰 검증하고 통과한 주장만 내보내는 접근이 있습니다. 2025년의 한 프리프린트는 이런 「라이선싱 오라클」이 사실 영역의 실험에서 기권 정밀도 1.0과 허위 답변 0건을 기록했고, 사실 응답의 정확도는 89.1%였다고 보고합니다. 기권 정밀도는 답하지 않고 물러선 경우 가운데 물러서는 것이 옳았던 비율입니다. 저자들은 구조화된 지식이 있는 영역에서는 이 방식이 통계적 방법이 줄 수 없는 보증을 준다고 주장합니다. 같은 연구에서 검색증강과 미세조정은 성능을 높였지만 환각을 없애지는 못했습니다 (arXiv:2511.06073). 미세조정은 학습을 마친 모델을 골라 모은 예시로 한 번 더 학습시키는 일입니다. 단일 프리프린트이고 「구조화된 지식이 있는 영역」이라는 조건이 붙습니다. LLM은 속을 들여다보기 어려운 블랙박스이고 사실 지식을 담고 꺼내는 데 자주 모자란다는 2023년 로드맵 논문의 지적과도 맞닿습니다 (arXiv:2306.08302).

모델이 크면 나아지나
더 큰 모델이면 덜 틀리리라는 기대는 부분적으로 맞습니다. 장문 사실성은 긴 대답에 담긴 개별 사실들이 얼마나 맞는지를 가리킵니다. 2024년의 한 연구는 긴 대답을 개별 사실로 쪼개 하나씩 검색으로 확인하는 자동 평가기를 만들었습니다. 약 1만 6천 건의 개별 사실에서 이 평가기는 온라인으로 모집한 사람 판정자와 72% 일치했습니다. 판정이 갈린 경우에서 무작위로 고른 100건 가운데 76%에서는 평가기가 사람보다 옳았고, 비용은 사람보다 20배 넘게 쌌습니다. 이 평가기로 여러 모델을 견주자 대체로 큰 모델이 더 나은 장문 사실성을 보였습니다 (arXiv:2403.18802).
앞의 영상 벤치마크는 데이터와 파라미터, 곧 학습으로 정해지는 모델 안의 숫자를 늘리면 기본적인 시각 단서나 실제와 다르게 바꿔 놓은 내용을 알아채는 능력은 좋아진다고 보고합니다. 그러나 외재적 사실 환각을 잡는 데는 키운 효과가 제한적이었습니다 (arXiv:2406.16338).
더 근본적인 회색지대도 있습니다. 2024년의 한 이론 프리프린트는 형식적인 틀에서 환각은 LLM의 타고난 한계이며 완전히 없앨 수는 없다고 주장합니다 (arXiv:2401.11817). 이 틀에서 환각은 계산 가능한 LLM과 계산 가능한 정답 함수 사이의 불일치입니다. LLM은 계산 가능한 함수를 모두 배울 수는 없으므로, 범용 문제 해결기로 쓰이는 한 반드시 환각한다는 논리입니다. 앞에서 본 「최적의 추정기도 환각한다」(arXiv:2509.21473)와 결이 같습니다. 구조화된 지식이 있는 영역에서 외부 검증 단계를 붙인 시스템이 보증을 준다는 주장(arXiv:2511.06073)과, LLM이 범용 문제 해결기로서 지닌 한계에 대한 주장은 서로 다른 범위를 두고 하는 말입니다. 이 이론들이 맞다면 목표는 환각을 0으로 만드는 것보다, 관리할 수 있는 수준으로 다루고 불확실성을 정직하게 드러내는 쪽이 됩니다.
그래서 무엇을 기억할까
2025년의 프리프린트들이 내놓은 설명을 모으면, LLM의 환각은 학습과 평가 방식에서 따라 나오는 통계적 부산물에 가깝다는 그림이 됩니다 (arXiv:2503.21676; arXiv:2509.04664; arXiv:2509.21473). 그래서 「AI가 거짓말한다」보다 「AI는 모를 때도 그럴듯하게 메운다」가 더 정확한 표현입니다.
의료처럼 틀리면 위험한 영역에서는(arXiv:2506.00448) 출력을 그대로 믿기보다 인용과 근거를 직접 확인하는 편이 안전합니다. 한 연구에서 검색증강과 미세조정은 환각을 없애지 못했고 (arXiv:2511.06073), 자기 검증도 환각을 줄였다는 보고가 있을 뿐 없앴다는 보고는 아닙니다 (arXiv:2402.09267; arXiv:2506.22486). 이런 도구를 붙였더라도 그것은 완화이고 보증은 아닙니다. AI가 자신 있게 말한다는 것은 그 말이 맞다는 신호가 되지 못합니다.
이 분야는 매우 빠르게 바뀌고 있고, 위에 인용한 근거의 상당수는 동료심사를 거치기 전의 프리프린트(arXiv)입니다. 확정된 과학 사실보다는 2023~2026년에 진행된 연구의 한 단면으로 읽어 주시기 바랍니다.
근거 논문
작동 원리 · 환각의 통계적 뿌리
- arXiv:2503.21676 — 사실 학습 동역학, 환각은 지식과 동시에 출현
- arXiv:2509.04664 — "왜 환각하는가": 학습·평가가 찍기를 보상, 환각은 이진 분류 오류
- arXiv:2509.21473 — 손실 최소화 최적 추정기도 환각(확률적 하한)
의인화 · 기만 신화 점검
- arXiv:2403.09676 — LLM '기만' 유형 분류(전략적 기만·모방·아첨·불성실 추론)
- arXiv:2510.18439 — 환각은 입력 대신 '언어적 사전확률'에 기댈 때 발생(수어 번역)
환각의 종류(내재적/외재적)
- arXiv:2511.10837 — 내재적·외재적 구분, 탐지 기법이 유형별로 다르게 작동
- arXiv:2406.16338 — 영상-언어 환각 벤치마크, 하위 유형, 스케일링의 제한적 효과
탐지 · 완화 기법과 한계
- arXiv:2510.22344 — RAG는 완화하나 다단계 질문에서 흔들림
- arXiv:2604.04020 — 어텐션 기반 기법, RAG 대비 환각률 감소(단일 벤치마크)
- arXiv:2402.09267 — 자기 평가 기반 사실성 정렬(TruthfulQA 등)
- arXiv:2506.22486 — 작은 모델 다수로 문장 단위 사실성 검증
- arXiv:2603.22812 — 의미 엔트로피의 적응적 샘플링(비용 절감)
- arXiv:2511.06073 — 지식 그래프 검증(RAG·파인튜닝은 제거 못함)
- arXiv:2306.08302 — LLM은 블랙박스, 사실 지식 보관·접근에 취약
모델 크기 · 이론적 한계
- arXiv:2403.18802 — 큰 모델이 대체로 장문 사실성 더 우수
- arXiv:2401.11817 — 환각은 타고난 한계, 완전 제거 불가능(이론)
고위험 도메인
- arXiv:2506.00448 — 의료 대화 요약의 환각, 일반 도메인 탐지기의 한계