
Paperis 아티클
AI는 정말 '생각'하는가 — 아직 학계가 다투는 중인 질문
사고연쇄는 추론인가 배운 풀이의 흉내인가, 양쪽 논문을 나란히 놓습니다.
답이 정의와 시험에 따라 갈리는 물음
어려운 문제를 던지면 AI가 답을 바로 내놓지 않고 "먼저 이걸 계산하고, 그다음 저걸 따지면…" 하며 풀이를 늘어놓을 때가 있습니다. 사고연쇄는 AI가 답을 내기 전에 중간 풀이 단계를 문장으로 하나씩 적어 내려가는 것입니다. 영어로는 Chain-of-Thought, 줄여 CoT입니다. 화면에 쌓이는 그 문장들을 보면 기계가 정말 '생각'하는 것 같습니다.
「AI 모델 — 규칙 대신 예시에서 배우는 계산」은 처음 보는 데이터에서 점수가 나오는 일반화가 곧 이해인지를 물음으로 남겼습니다. 그 첫걸음은 다 배운 모델을 실제로 쓰는 일을 추론이라 불렀습니다. 이 글에서 추론은 그와 달리 주어진 사실에서 단계를 밟아 결론을 끌어내는 일이고, 그 정확한 뜻부터가 다툼거리입니다. 이 글은 그 물음을 이 뜻의 추론에 좁혀 따라갑니다.

AI가 추론하느냐를 두고 학계는 아직 합의에 이르지 못했습니다. 답은 추론을 어떻게 정의하고 어떤 문제로 시험하느냐에 따라 갈리고, 연구자들은 지금도 논문으로 서로 반박합니다.
회의 쪽: "배운 풀이를 흉내 내는 것일 수 있다"
회의 쪽 증거는 문제를 살짝 비트는 실험에서 나옵니다. 초등 수준 수학 문제에서 숫자만 바꿔도 시험한 2024년의 최신 모델들은 모두 성적이 떨어졌고, 답과 무관하지만 관련 있어 보이는 문장 하나를 끼우자 성능이 최대 65%까지 떨어졌습니다. 문항의 조건 마디(절)가 늘어날수록 성능은 크게 나빠졌습니다. 저자들은 그 원인을 "현재 모델이 진짜 논리 추론을 하지 못하고 학습 데이터의 추론 단계를 복제하기 때문"이라고 가설로 제시했습니다 (arXiv:2410.05229).
유추에서도 같은 다툼이 있었습니다. GPT-3가 예시 없이 유추 문제를 푸는 능력을 저절로 얻었다는 주장에, 반박 연구는 글자 줄 사이의 규칙을 찾아 옮기는 글자열 유추 과제로 반례를 냈습니다. 원 과제를 살짝만 바꾼 가장 단순한 판에서도 GPT-3는 실패했고 사람은 높은 성적을 유지했습니다. 저자들은 "데이터 암기를 배제할 방법론이 필요하다"고 못 박았습니다 (arXiv:2308.16118).
벤치마크 오염이라는 의심도 겹칩니다. 「AI의 오류 — 시험장 밖에서 틀리는 수험생」의 말로, 벤치마크 오염은 시험 문제나 그와 아주 비슷한 글이 학습 데이터에 미리 섞여 들어가는 일입니다. 그러면 문제를 푼 것인지 외운 답을 내놓은 것인지 가리기 어렵습니다. 한 공동 과제는 수백 건의 오염 사례를 공개 데이터베이스로 모아 평가 결과의 신뢰성 문제를 드러냈습니다 (arXiv:2407.21530). 원인과 결과를 따지는 인과추론을 잰다는 벤치마크도 상당수가 분야 지식을 꺼내 오는 것만으로 풀릴 가능성이 있어, 정말 추론을 재는지 의심받습니다 (arXiv:2407.08029).
조건이 깔끔하지 않으면 약점이 드러납니다. 강화학습, 곧 해 본 대답에 점수를 주며 고쳐 가는 방식으로 미세조정한 모델은 이상적 조건에서는 추론 성적이 올랐지만, 요약 추론·잡음 억제·맥락 필터링이라는 '비이상적' 상황 셋에서는 모두 성능이 크게 떨어졌습니다. 저자들은 상황별 보완법을 제안하면서도 지금의 방법으로는 이 결손이 대체로 남는다고 봤고, "대형 모델의 추론 능력은 종종 과장돼 있다"고 결론지었습니다 (arXiv:2508.04848). 사람이면 완벽히 해내는 낱말의 '글자 구성' 과제조차, 2024년에 시험한 모델 대부분은 안정적으로 해내지 못했습니다 (arXiv:2405.11357).
"사고의 환상"인가, 도구가 없었을 뿐인가
추론 모델은 답을 내기 전에 긴 사고연쇄를 먼저 써 내려가도록 만든 모델입니다. 이 모델을 둘러싼 논쟁 한복판에 2025년의 "사고의 환상(The Illusion of Thinking)"이라는 연구가 있습니다. 이 연구를 다룬 한 논평에 따르면, 원 연구는 문제 복잡도가 일정 문턱을 넘으면 추론 모델 성능이 절벽처럼 무너지는 '추론 절벽'을 발견하고, 이를 사고연쇄 추론이 규모를 키워도 넘지 못하는 본질적 한계로 해석했습니다.
논평은 원 연구의 방법이 엄밀하다고 인정하면서도 이 붕괴를 다르게 읽습니다. 글만 쓰게 하는 평가 환경의 제약들, 곧 도구 사용 금지, 긴 맥락을 되찾지 못하는 문제, 핵심 인지 기준선의 부재, 미흡한 통계 보고, 출력 길이 제한이 겹친 결과라는 것입니다. 글만 쓸 때 퍼즐을 "불가능하다"던 한 모델이 도구를 쥐자 그 퍼즐을 풀고 추론 절벽 너머의 난도까지 해냈다고 논평은 보고합니다. 행위 격차는 이 논평이 붙인 이름입니다. 논평은 이 성능 붕괴를, 모델이 풀이를 실행할 도구가 막힌 환경에서 실행에 실패해 생긴 격차로 봅니다 (arXiv:2506.18957). 같은 사실을 한쪽은 "본질적 한계"로, 다른 쪽은 "환경 탓"으로 읽는 것이 이 분야 논쟁의 전형입니다.
능력 쪽: "실제로 어려운 문제를 더 푼다"
능력 쪽에도 증거가 쌓여 있습니다. 답 전에 더 길게 생각하게 하면 까다로운 과제 성적이 오른다는 것입니다. 긴 사고연쇄 서베이는 깊은 추론·폭넓은 탐색·되돌아보는 점검이 복잡한 문제 해결을 돕는다고 정리하면서도, '과도한 생각'과 답할 때 계산을 더 들이는 방식을 둘러싼 논쟁이 여전하다고 적습니다 (arXiv:2503.09567).
12개 모델을 중국어·영어 법률 과제 17종으로 처음 체계 평가한 연구에서는 중국어 과제에서 DeepSeek-R1이 뚜렷이 앞섰고 영어 과제에서는 o1이 그에 견줄 만한 성적을 냈으며, 저자들이 만든 법률 특화 모델도 여러 과제에서 경쟁력 있는 성적을 냈습니다. 다만 오류 분석에서는 낡은 법 지식, 법 해석의 한계, 사실과 다른 내용을 지어내는 환각이 반복됐습니다 (arXiv:2503.16040).
잠자는 시간 연산은 질문이 오기 전에 주어진 맥락을 두고 미리 계산해 두는 방식입니다. 이 방식은 같은 정확도를 답할 때의 연산을 5배 적게 써서 냈고, 미리 하는 연산을 늘리면 정확도가 두 과제에서 각각 최대 13%·18% 올랐습니다. 다만 효과는 사용자가 무엇을 물을지 예측할 수 있는 정도와 강하게 맞물렸습니다 (arXiv:2504.13171).
교육용 고차원 사고 검사로 사람과 견준 한 평가도 있습니다. 추론 모델 o1-preview는 대부분의 범주에서 사람을 앞섰고, 시스템 사고·계산적 사고·데이터 리터러시·창의적 사고·과학적 추론·추상적 추론에서는 사람보다 150% 더 나은 결과를 냈다고 저자들은 보고합니다. 초록은 비교한 사람 집단과 이 비율의 기준을 밝히지 않습니다. 반면 논리적 추론·비판적 사고·정량적 추론에서는 약 25% 떨어졌고, 유추 추론에서는 사람과 모델이 모두 만점이었습니다. 다만 같은 초록이 추상적 추론을 우위 목록에 넣으면서도 그 항목에서 심리학 전공생이 모델을 앞섰다고 적어, 이 항목의 보고는 내적으로 엇갈립니다 (arXiv:2410.21287). 추론 능력은 있다·없다로 갈리기보다 과제마다 들쭉날쭉합니다. 계획 능력을 본 한 예비 연구(pilot study)에서도 o1-preview는 구조화된 환경에서 제약 준수와 상태 관리로 GPT-4를 앞섰지만, 불필요한 행동이 섞인 풀이를 자주 냈고 공간적으로 복잡한 과제에서는 일반화에 약했습니다 (arXiv:2409.19924). 한 기호 추론 벤치마크에서 추론 모델은 일반 언어모델보다 더 긴 관계와 넓은 속성을 잘 다뤘지만, 불확실성이 섞인 문제에서는 여전히 크게 막혔습니다 (arXiv:2510.17496).

미묘한 함정: 화면의 풀이와 실제 계산이 어긋날 수 있다
충실성은 모델이 적어 내놓은 풀이가 실제로 그 답에 이른 과정을 반영하는 정도입니다. 2023년의 한 연구는 화면의 사고연쇄가 답에 이른 길을 반드시 보여 주지는 않는다고 적었습니다. 그 대안으로, 언어모델은 질문을 기호 풀이로 옮기기만 하고 계산은 규칙대로만 움직이는 외부 풀이 프로그램에 맡기는 방식을 제안했습니다. 이 방식은 표준 사고연쇄를 네 개 영역 10개 벤치마크 중 9개에서 앞섰고, 충실성과 정확도가 함께 갈 수 있음을 보였습니다 (arXiv:2301.13379). 이런 '불충실한 추론'은 한 에세이 형식의 검토에서 기만적 행동의 한 유형으로 분류되기도 했습니다 (arXiv:2403.09676).

추론 행동 자체가 모델 안쪽의 구조에 대응한다는 연구도 있습니다. '생각하는' 모델 셋의 내부를 본 연구는 불확실성 표현·예시 생성·되짚기 같은 추론 행동이 모델 안쪽 숫자들이 이루는 공간의 특정 방향에 대응함을 보였습니다. 스티어링 벡터는 그 방향을 뽑아 더하거나 빼서 해당 행동을 키우거나 줄이는 데 쓰는 값입니다 (arXiv:2506.18167). 적어도 그 모델들에서는 풀이 행동 뒤에 떼어 조절할 수 있는 구조가 있다는 뜻입니다. 이 연구가 잰 것은 풀이 행동을 조절하는 구조이고, 적힌 풀이가 실제 계산과 맞는지는 따로 남는 물음입니다.
그래서 — 먼저 점검할 것은 '생각한다'는 말
가장 큰 함정은 단어 자체일지 모릅니다. 기계가 풀이를 늘어놓으면 우리는 "생각한다"고 사람에 빗대지만, 벤치마크가 재는 것은 문제를 맞히느냐이고 사람처럼 생각하느냐는 점수에 들어 있지 않습니다. '창발 능력'도 원래는 작은 모델엔 없다가 큰 모델에서 나타나 작은 모델의 성적을 늘여 그려서는 예측할 수 없는 능력을 가리켰습니다 (arXiv:2206.07682). 앞의 유추 반박은 사람 같은 추론을 주장하려면 데이터 암기를 배제할 방법이 필요하다고 했습니다 (arXiv:2308.16118). 2026년에 공개된 긴 호흡 추론 벤치마크는 풀이가 수만에서 수십만 토큰에 걸치는 문제를 모았습니다. 토큰은 언어모델이 글을 잘라 다루는 조각입니다. 공개 당시 가장 좋은 모델들도 정확도가 10% 미만이었고, 각 단계는 풀 수 있으면서도 길게 엮는 데서 무너졌습니다 (arXiv:2604.14140).
"추론처럼 보이는 것"과 "추론"은 다를 수 있고, 둘이 어디서 갈리는지를 두고 지금 연구가 다투고 있습니다. 한 연구는 숫자만 바꿔도 무너진다며 "복제"라는 가설을 내놓고 (arXiv:2410.05229), 한 논평은 도구만 쥐여 주면 절벽을 넘는다며 "환경 탓"이라 합니다 (arXiv:2506.18957). 둘 다 같은 종류의 기계를 보고 있습니다.
이 글은 빠르게 바뀌고 여전히 논쟁 중인 분야를 다룹니다. 인용한 근거의 상당수는 동료심사 전 프리프린트이며 추후 결론이 바뀔 수 있습니다. 특정 입장을 정답으로 단정하지 않으려 했습니다.
근거 논문 (arXiv)
- arXiv:2410.05229 — GSM-Symbolic: 수학 추론의 한계
- arXiv:2308.16118 — '창발적 유추 추론' 주장에 대한 반박
- arXiv:2407.21530 — 2024 CONDA 데이터 오염 보고
- arXiv:2407.08029 — 인과추론 벤치마크 비판적 검토
- arXiv:2508.04848 — 비이상적 조건에서의 추론 능력
- arXiv:2405.11357 — LLM의 글자 구성 이해 결여
- arXiv:2506.18957 — "사고의 환상" 논평: 추론 절벽 vs 행위 격차
- arXiv:2503.09567 — 긴 사고연쇄(Long CoT) 서베이
- arXiv:2503.16040 — 법률 추론에서의 추론 시점 스케일링
- arXiv:2504.13171 — 잠자는 시간 연산(sleep-time compute)
- arXiv:2410.21287 — o1-preview의 고차원 사고 평가
- arXiv:2409.19924 — o1 모델의 계획 능력
- arXiv:2510.17496 — I-RAVEN-X: 유추·수학 추론의 일반화·강건성
- arXiv:2301.13379 — 충실한 사고연쇄(Faithful CoT)
- arXiv:2403.09676 — LLM의 기만적 능력(불충실한 추론)
- arXiv:2506.18167 — 스티어링 벡터로 본 '생각하는' 모델
- arXiv:2206.07682 — 대형 언어모델의 창발 능력
- arXiv:2604.14140 — LongCoT: 긴 호흡 추론 벤치마크