Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

다음 낱말을 맞히는 훈련이 어떻게 대화가 되는가 — 언어모델을 읽기 위한 최소 토대

다음 토큰을 맞히는 훈련 위에 무엇이 더 얹혀 우리가 쓰는 물건이 되는가 — 토큰으로 자르는 방식의 함정, 2년 만에 고쳐진 스케일링 법칙, 사람의 선호를 입히는 정렬, 파라미터를 고치지 않고도 달라지는 맥락 내 학습, 그리고 아직 답이 갈린 자리

🧱기초✦AI 생성컴퓨터과학·AI · 2026년 10월 8일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

다음 낱말을 맞히는 훈련이 어떻게 대화가 되는가 — 언어모델을 읽기 위한 최소 토대

첫걸음이 세워 둔 것, 그리고 남은 물음

지금 이 문장의 다음 낱말을 맞혀 보라고 하면 대부분의 사람은 후보 몇 개를 떠올립니다. 언어모델이 훈련받는 일이 바로 이것입니다. 「생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장」은 이 일을 다음 토큰 예측이라 불렀습니다. 토큰, 곧 언어모델이 글을 잘라 다루는 조각을 기준으로, 앞에 놓인 토큰들을 보고 바로 다음에 올 토큰의 후보마다 확률을 매기는 일입니다.

사람과 언어모델에게 이 일을 똑같이 시켜 본 실험이 있습니다. 가장 그럴듯하다고 고른 하나가 맞는 비율로 재도, 정답에 확률을 얼마나 주었는지로 재도, 사람은 비교적 작은 언어모델보다 일관되게 나빴습니다 (arXiv:2212.11281, 프리프린트). 같은 논문은 언어모델이 질문에 답하거나 코드를 짜도록 훈련된 것이 아니라 다음 토큰을 맞히도록 훈련됐다는 데서 출발합니다. 이 결과는 훈련받은 과제에서의 차이이고, 사람은 그 과제를 연습한 적이 없습니다. 훈련 목표와 우리가 기대하는 능력은 서로 다른 축이고, 논문이 무엇을 쟀는지 확인하지 않으면 어떤 비교도 읽을 수 없습니다.

나머지 바탕도 첫걸음들이 세워 두었습니다. 「생성형 AI의 대답」은 엄청난 양의 글로 다음 토큰 맞히기를 되풀이하는 사전학습, 고른 예시로 한 번 더 다듬는 미세조정, 입력의 어느 부분에 얼마나 주목할지 계산하는 어텐션과 그것을 뼈대로 삼은 트랜스포머까지 따라갔습니다. 2017년에 어텐션만으로 짠 구조로 제안된 트랜스포머는 번역 과제에서 계산을 나눠 돌리기 쉽고 학습 시간이 훨씬 짧았습니다 (DOI: 10.65215/2q58a426). 왜 하필 그 꼴인지는 뒤늦게 설명하려는 시도가 이어지고, 한 프리프린트는 말뭉치에서 낱말들이 함께 나타나는 통계를 문장의 맥락에 비추면 그 꼴이 따라 나온다고 주장합니다 (arXiv:2511.13780, 프리프린트). 「신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것」은 모델을 키우면 손실, 곧 모델의 답이 정답에서 벗어난 정도가 줄어든다는 관찰과, 큰 모델에서 능력이 갑자기 튀어나오는지를 둘러싼 다툼을 세웠습니다.

이 글은 그 위에서 시작합니다. 훈련 목표는 하나뿐인데, 우리가 쓰는 물건은 그 훈련만 받은 물건이 아닙니다. 이 사이를 세 물음으로 따라갑니다. 토큰으로 자르는 방식이 어떤 함정을 낳는가, 모델을 키우면 무엇이 어떻게 좋아지는가, 학습을 다시 하지 않고도 대화창의 예시만으로 모델이 달라지는 현상은 무엇인가입니다. 그 사이에 사람의 선호를 입히는 단계를 한 번 더 자세히 보고, 마지막에는 아직 답이 갈린 자리를 갈린 채로 적습니다.

여기 인용한 연구는 대부분 arXiv에 공개된 프리프린트, 곧 동료심사를 거치기 전에 올라온 판입니다. 프리프린트라고 틀렸다는 뜻은 아니지만, 심사를 거친 결과와 같은 무게로 읽지는 않습니다. 이 글의 수치는 모두 그 논문이 그 시점에 그 조건에서 잰 값이고, 이 분야에서는 그런 값이 빠르게 낡습니다.

토큰으로 자르는 방식이 낳는 함정

2013년에 낱말을 숫자 묶음으로 바꾸는 방법을 내놓은 저자들은 스스로 한계를 적었습니다. 그 표현은 낱말의 순서에 무관심하고 관용구를 나타내지 못해서, "Canada"와 "Air"의 뜻을 합쳐도 "Air Canada"가 되지 않는다는 것입니다 (DOI: 10.48550/arxiv.1310.4546, 프리프린트). 글을 어떤 단위로 잘라 보느냐는 그때부터 결과를 바꾸는 선택이었습니다.

지금의 언어모델은 글을 토큰으로 자릅니다. 「생성형 AI의 대답」의 말로 토큰은 언어모델이 글을 잘라 다루는 단위로, 낱말 하나일 때도 있고 낱말의 한 조각이나 문장부호일 때도 있습니다. 부분단어는 낱말보다 작게 잘린 조각으로, 흔한 낱말은 통째로 한 조각이 되기 쉽고 드문 낱말은 여러 조각으로 쪼개집니다. 언어모델은 대개 미리 정해 둔 부분단어 목록에서 조각을 골라 글을 자르고, 토크나이저는 이렇게 글을 토큰으로 자르는 법을 정해 둔 도구입니다.

이 자르기에는 값이 따릅니다. 자르는 결과는 오타나 글 길이의 변화에 쉽게 흔들리고, 모델은 한 토큰 안에 어떤 글자가 들었는지에 대체로 어둡습니다. 이 문제를 「토큰화의 저주」라 부른 연구는 큰 언어모델도 여전히 이 문제에 약하다는 것을 세 갈래 물음으로 보였습니다. 모델을 키우면 나아지지만 오타와 형식 변화가 만드는 치우침은 남았고, 자르는 법을 학습 중에 조금씩 흔들어 주는 기법이 이 문제를 덜어 준다고 저자들은 보고합니다 (arXiv:2406.11687, 프리프린트).

자르기의 비용은 언어마다 다릅니다. 같은 글을 여러 언어로 옮겨 토큰 수를 세면 길이가 크게 달라져, 어떤 경우에는 15배까지 차이가 납니다. 여러 언어를 고루 지원하려고 만든 토크나이저에서도 이 격차는 남았습니다. 그 결과 상업 서비스의 이용료, 처리 시간과 지연, 모델 앞에 한 번에 넣을 수 있는 글의 양이 언어 공동체마다 고르지 않게 됩니다 (arXiv:2305.15425, 프리프린트). 같은 내용을 묻더라도 쓰는 언어에 따라 더 많은 값을 치를 수 있다는 뜻입니다.

같은 글을 옮긴 두 줄의 토큰 블록. 위 줄은 가장 짧게 잘린 쪽으로 블록 두 개에 1이라 적혀 있고, 아래 줄은 어떤 경우의 가장 길게 잘린 쪽으로 블록 서른 개가 길게 이어지며 최대 15배라 적혀 있다. 블록 수는 비율만 나타낸다는 주석이 붙어 있다. 그 아래에 여러 언어용 토크나이저에서도 격차가 남았다는 한 줄과, 언어 공동체마다 고르지 않게 되는 세 가지 — 상업 서비스 이용료, 처리 시간과 지연, 한 번에 넣을 수 있는 글의 양 — 가 칸으로 놓여 있다.

토큰 경계가 낱말의 뜻 단위인 형태소 경계와 잘 맞으면 더 좋은 토크나이저일 것 같습니다. 그 맞는 정도를 70개 언어에서 재고, 사전학습한 모델 5개가 과제 7개에서 낸 성적과 견준 연구가 있습니다. 형태소 경계와 맞는 정도는 성적의 차이를 그다지 설명하지 못했습니다 (arXiv:2507.06378, 프리프린트). 무엇이 좋은 토큰화인지에 대한 합의는 아직 없습니다.

함정 하나는 더 미세합니다. 대부분의 언어모델에서 부분단어 조각은 낱말 앞의 띄어쓰기를 달고 있습니다. 그래서 한 낱말이 어디서 끝나는지는 그 낱말의 조각만 봐서는 정해지지 않고, 다음 조각이 띄어쓰기로 시작하는지를 봐야 압니다. 사람이 글을 읽을 때 느끼는 어려움을 재려고 연구자들은 흔히 조각의 확률을 합쳐 낱말의 확률로 쓰는데, 이 방식은 확률의 합이 1을 넘는 분포를 낳을 수 있다는 것이 증명됐습니다 (arXiv:2406.10851, 프리프린트). 확률이라면 지켜야 할 기본 규칙이 이렇게 깨진다는 것은, 토큰이 우리가 생각하는 언어의 단위와 다른 것임을 보여 줍니다. 저자들은 뒤따르는 띄어쓰기의 확률을 현재 낱말 쪽으로 옮겨 계산하는 간단한 보정으로 이 문제를 풀 수 있음을 보였습니다.

토큰은 낱말이 아닙니다. 이 한 줄을 붙들고 있으면, 모델이 글자 수를 잘 못 센다는 관찰이 그리 놀랍지 않습니다. 모델이 보는 단위는 글자 묶음인 조각이고, 한 조각 안에 든 글자에는 대체로 어둡기 때문입니다.

키우면 무엇이 좋아지는가 — 2년 만에 고쳐진 처방

「신경망과 파라미터」가 세운 스케일링 법칙은 모델의 크기, 학습 데이터의 양, 학습에 쓴 계산량을 늘릴 때 손실이 얼마나 줄어드는지를 따라가 본 경향입니다. 2020년의 프리프린트는 손실이 세 가지에 대해 거듭제곱 모양으로 줄고 일부 경향은 7자릿수 넘는 범위에서 이어진다고 보고하면서, 이 관계로 정해진 계산 예산을 어디에 나눌지 정할 수 있다고 주장했습니다. 그 처방은 아주 큰 모델을 비교적 적은 데이터로 학습시키고 다 수렴하기 훨씬 전에 멈추라는 것이었습니다 (arXiv:2001.08361, 프리프린트). 경험으로 알던 「키우면 좋아진다」에, 얼마나 좋아질지 미리 계산하는 식이 붙은 것입니다.

그 처방이 2년 뒤에 고쳐졌습니다. 2022년 연구는 당시의 큰 언어모델들이 데이터에 비해 크게 덜 학습됐다고 결론 내렸고, 그 원인을 데이터 양은 그대로 둔 채 모델만 키워 온 흐름에서 찾았습니다. 7,000만에서 160억 넘는 파라미터까지 400개 넘는 모델을 50억에서 5,000억 토큰으로 학습시켜 본 결과, 계산 예산을 가장 알뜰하게 쓰려면 모델 크기와 학습 토큰 수를 같은 비율로 늘려야 했습니다. 그 예측대로 2,800억 파라미터 모델과 같은 계산 예산을 쓰면서 파라미터는 700억으로 줄이고 데이터는 네 배로 늘린 모델은, 2,800억·1,750억·5,300억 파라미터 모델들을 여러 평가 과제에서 고르게 앞섰습니다 (arXiv:2203.15556, 프리프린트). 여기서 볼 것은 고쳐진 방식입니다. 400개 넘는 모델로 최적점을 다시 찾았고, 그 최적점을 실제 모델로 검증했습니다.

두 모델을 두 줄로 견준 막대 도식. 위 줄의 2,800억 파라미터 모델은 파라미터 막대가 길고 학습 데이터 막대는 기준 길이로 짧다. 아래 줄의 700억 파라미터 모델은 파라미터 막대가 위의 4분의 1이고 학습 데이터 막대는 기준의 네 배다. 두 줄을 오른쪽 괄호가 같은 계산 예산으로 묶는다. 아래에 700억 모델이 2,800억·1,750억·5,300억 파라미터 모델들을 여러 평가 과제에서 고르게 앞섰다는 줄과, 고쳐진 것은 손실이 준다는 경향이 아니라 예산을 나누는 비율이라는 줄이 있다.

스케일링 법칙은 법칙이라기보다 관측이고, 그 관측에서 끌어낸 처방은 고쳐질 수 있습니다. 2022년 연구가 고친 것은 손실이 준다는 경향이 아니라, 정해진 계산 예산을 모델과 데이터에 나누는 비율이었습니다. 그래서 규모에 관한 주장을 읽을 때는 어느 자원을 늘리고 무엇을 고정한 채 쟀는지부터 봅니다. 파라미터만 늘렸는지, 데이터도 함께 늘렸는지, 계산 예산을 일정하게 묶었는지에 따라 같은 말이 다른 뜻이 됩니다.

「좋아진다」의 뜻도 따져 볼 자리입니다. 스케일링 법칙 연구가 재는 손실은 대개 교차엔트로피입니다. 교차엔트로피는 모델이 정답 토큰에 매긴 확률이 낮을수록 커지는 손실입니다. 이 값은 정답에 준 확률의 크기만 재고, 정답이 다른 후보들보다 앞 순위에 섰는지는 보지 않습니다. 그런데 늘 1등 후보를 고르는 방식처럼, 실제로 글을 만들 때는 그 순위가 중요한 경우가 많습니다. 그래서 정답 토큰이 상위 후보 안에 드는 확률을 잣대로 스케일링 법칙을 다시 세운 연구가 나와 있습니다 (arXiv:2510.20387, 프리프린트). 저자들은 이 법칙이 교차엔트로피로 본 그림을 대신하지 않고 보완한다고 봅니다.

손실이 줄어도 실제로 시키는 일의 성적이 따라오지 않을 수 있습니다. 하류 과제는 사전학습을 마친 모델에 실제로 맡기는 번역 같은 개별 과제입니다. 사전학습 데이터와 번역 과제 데이터가 충분히 닮았을 때는 사전학습을 늘릴수록 번역 점수도 꾸준히 좋아졌고 미리 예측할 수도 있었습니다. 둘이 적당히 어긋나 있을 때는 번역 점수가 오르내리거나 사전학습을 더 할수록 나빠지기도 했는데, 그동안에도 하류 과제에서 잰 교차엔트로피는 꾸준히 좋아졌습니다 (arXiv:2402.04177, 프리프린트). 손실이 좋아지는 것과 우리가 원하는 것이 좋아지는 것은 다른 일입니다.

왜 이런 모양이 나오는지도 정리되지 않았습니다. 흔한 설명은 데이터 안에 이미 거듭제곱 구조가 있어서라는 것입니다. 그런데 그래프 위를 무작위로 걷는 경로를 맞히도록 학습한 트랜스포머에서는, 데이터에 그런 구조가 없는데도 스케일링 법칙이 나타났습니다 (arXiv:2601.10684, 프리프린트). 스케일링 법칙은 어떤 조건에서 어떤 잣대로 쟀을 때 거듭 나타난 경험적 규칙성이고, 왜 성립하는지는 아직 합의된 설명이 없습니다.

사전학습 다음에 오는 것 — 사람의 선호를 입히는 정렬

2022년의 한 프리프린트는 언어모델을 크게 만든다고 사용자의 의도를 저절로 더 잘 따르게 되지는 않는다는 문장으로 시작합니다. 큰 모델도 사실이 아니거나 해롭거나 그저 도움이 안 되는 글을 낼 수 있고, 저자들의 말로 이 모델들은 사용자와 정렬되어 있지 않습니다 (arXiv:2203.02155, 프리프린트). 정렬은 모델이 내놓는 것을 사용자의 의도와 사람의 가치에 맞추는 일입니다.

다음 토큰 예측이 겨냥하는 것은 학습한 글에서 이어질 법한 말이고, 그 글에는 도움이 안 되는 말도 사실이 아닌 말도 섞여 있습니다. 사전학습만 마친 모델은 그런 이어짐도 그대로 따라 합니다. 「생성형 AI의 대답」이 따라간 다듬기 두 단계, 곧 사람이 쓴 모범 대답을 따라 하게 하는 미세조정과 사람이 매긴 순위로 고치는 사람 피드백 강화학습(RLHF)이 이 틈을 메우려는 절차입니다. 그렇게 다듬은 13억 파라미터 모델의 대답이, 그 연구가 모은 부탁들에 대한 사람 평가에서 파라미터가 100배 많은 1,750억짜리 GPT-3의 대답보다 선호됐고, 그래도 단순한 실수는 남았다는 결과도 거기서 보았습니다 (arXiv:2203.02155). 이 결과가 이 글에서 갖는 뜻은 규모만이 축은 아닐 수 있다는 것입니다. 사전학습 뒤에 무엇을 했느냐가 사용자가 겪는 모델을 크게 바꿀 수 있습니다.

첫 단계는 흔히 지시학습이라 부릅니다. 지시학습은 지시와 그에 맞는 대답을 짝지은 예시로 하는 미세조정입니다. 어떤 지시를 어떤 비율로 섞어야 하는지는 아직 잘 이해되지 않았습니다. 지시를 자연어 처리 과제·코딩·일반 대화의 세 유형으로 나눠 섞는 비율을 바꿔 본 연구는, 어떤 유형이 한 쓰임에는 유리하면서 다른 쓰임에는 해가 될 수 있다고 보고합니다 (arXiv:2312.10793, 프리프린트). 둘째 단계인 사람 피드백 강화학습은 더 오래된 뿌리를 가집니다. 사람이 미리 설계한 점수 규칙 대신 사람의 피드백에서 배우는 강화학습의 한 변형으로, 사람의 선호를 신호로 삼는 강화학습이라는 선행 분야 위에 서 있고, 기초 기법의 상당수는 기계 제어와 로봇 분야에서 왔습니다 (arXiv:2312.14925, 프리프린트).

이 절차에는 가정이 들어 있습니다. 대부분의 접근은 사람을 다소 잡음이 섞였을 뿐 합리적이고, 특히 치우침 없는 피드백을 주는 존재로 놓습니다. 이 사람 모형이 지나치게 단순하며, 사람에 대한 모형은 사람마다 다르고 맥락에 따라 달라지며 시간이 지나며 변하는 것이어야 한다는 문제 제기가 있습니다 (arXiv:2206.13316, 프리프린트). 누구의 선호냐는 물음도 남습니다. 사람 피드백 강화학습에 여러 관점을 함께 담아야 한다는 인식론적·윤리적 논증이 나와 있습니다 (arXiv:2407.17482, 프리프린트). 정렬은 기술적 절차이면서, 그 안에 누구의 가치를 넣을 것인가라는 물음을 품고 있습니다.

정렬이 무언가를 가져간다는 관측도 있습니다. 모드 붕괴는 모델의 출력이 몇 가지 꼴로 좁혀져 다양함을 잃는 현상입니다. 세 언어모델에서 뽑은 이야기 4,374편을 분석한 연구는, 한 모델 계열의 이어지는 판들이 점점 심한 모드 붕괴를 보였다고 보고합니다. 정렬 과정에서 모델을 지나치게 맞추면 여러 다른 작가의 목소리를 흉내 내는 능력이 제약되고, 여러 관점을 취하지 못하게 된다는 것입니다 (arXiv:2402.04477, 프리프린트). 특정 모델 계열의 특정 시점에 대한 관측이지만, 정렬이 능력을 더하기만 한다는 통념을 흔들기에는 충분합니다.

논문을 읽을 때는 그 논문이 사전학습만 마친 모델을 재는지, 지시학습과 정렬을 거친 모델을 재는지부터 확인합니다. 둘은 다른 물건이고, 여러 AI 모델에게 같은 문제를 풀게 해 점수를 견주도록 만들어 둔 시험 문제 모음인 벤치마크의 결과도 이 구분에 따라 달라질 수 있습니다.

학습을 다시 하지 않고 대화창의 예시만으로 — 맥락 내 학습

2020년에 GPT-3를 내놓은 프리프린트가 이상한 현상을 보고했습니다. 언어모델을 키우자 예시 몇 개만 보여 주는 방식의 성적이 크게 올랐고, 때로는 과제마다 미세조정한 당시 최고의 방법과 겨룰 만했습니다. 파라미터는 하나도 고치지 않았고, 과제 설명과 시범 예시 몇 개를 글로 적어 넣기만 했습니다 (DOI: 10.48550/arxiv.2005.14165, 프리프린트). 같은 논문은 이 방식이 여전히 고전하는 데이터셋과, 인터넷 글을 대량으로 학습한 데서 오는 방법론적 문제를 겪는 데이터셋도 있다고 적었습니다.

맥락 내 학습은 파라미터를 고치지 않고, 모델 앞에 놓인 글 속의 예시만으로 모델이 새 과제를 해내는 현상입니다. 이름에 「학습」이 들어가지만, 「신경망과 파라미터」가 따라간 학습처럼 손실을 줄이는 쪽으로 다이얼을 돌리는 일은 일어나지 않습니다. 파라미터는 하나도 바뀌지 않습니다. 바뀌는 것은 모델이 지금 보고 있는 앞글뿐입니다. 프롬프트는 대답을 받으려고 모델 앞에 넣는 글입니다. 프롬프트를 어떻게 쓰느냐가 결과를 바꾼다는 사실의 뿌리가 여기 있습니다.

두 칸 비교 도식. 왼쪽 미세조정 칸에서는 예시 카드 묶음이 화살표로 파라미터 격자에 들어가고, 격자의 여러 칸 색이 바뀌어 파라미터가 바뀐다고 적혀 있다. 오른쪽 맥락 내 학습 칸에서는 과제 설명, 예시 1·2·3, 새 문제가 적힌 프롬프트 상자가 화살표로 같은 모양의 파라미터 격자에 들어가는데, 격자의 칸은 모두 그대로이고 하나도 바뀌지 않는다고 적혀 있으며, 격자에서 답이 나온다.

왜 이런 일이 되는지는 설명이 여럿입니다. 한 이론은 자연어 데이터에 작은 연산을 조합하는 구조가 들어 있다는 데 주목합니다. 언어학적 가정 아래, 사전학습 데이터에 그런 구조가 충분하면 평범한 다음 토큰 예측에서 맥락 내 학습 능력이 나온다는 정보이론적 한계식을 유도했습니다 (arXiv:2303.07971, 프리프린트). 이 능력이 나타났다가 사라질 수도 있다는 관측도 있습니다. 학습 데이터에 특정한 분포적 성질이 있을 때 맥락 내 학습이 나타나지만 학습을 더 하면 줄어들 수 있다는 것이고, 한 연구는 단순화한 모형으로 이 출현과 소멸이 일어나는 조건을 이론으로 짚었습니다 (arXiv:2410.23042, 프리프린트).

맥락 내 학습에서 나온 가장 널리 알려진 기법이 사고연쇄 프롬프팅입니다. 사고연쇄 프롬프팅은 답에 이르는 중간 추론 단계를 적은 예시를 프롬프트에 넣어, 모델도 중간 단계를 적어 가며 답하게 하는 방법입니다. 이렇게 하면 복잡한 추론 성적이 크게 오른다는 보고이고, 이득은 극적일 수 있었습니다. 5,400억 파라미터 모델에 그런 예시 여덟 개만 주자 초등 수학 문장제 벤치마크에서 당시 최고 정확도에 이르렀고, 검증기를 붙여 미세조정한 GPT-3까지 앞섰습니다 (arXiv:2201.11903, 프리프린트). 그 논문이 이 능력을 관측한 조건은 충분히 큰 모델이었습니다.

대화창에 넣은 글을 모델이 고르게 쓰지는 않습니다. 긴 입력을 다루도록 따로 학습한 모델도 입력 한가운데 놓인 정보를 잘 잡아내지 못합니다. 한 연구는 이것을 어텐션의 U자형 위치 편향과 이었습니다. 관련이 있든 없든 입력의 처음과 끝에 놓인 토큰이 더 많은 주목을 받는다는 것입니다. 같은 연구는 이 편향을 보정하는 기법으로, 검색해 붙인 글로 답하는 여러 과제에서 기존 방법보다 최대 15%p 높은 성적을 보고했습니다 (arXiv:2406.16008, 프리프린트). 구조에서 오는 성질이지만 덜어 낼 수 있는 성질이라는 뜻입니다.

앞에 넣어 둔 예시가 뒤를 방해하는 일도 있습니다. 합성 회귀 과제로 훈련한 트랜스포머에서, 프롬프트 앞쪽의 잘못 이끄는 예시가 많을수록 뒤에 오는 과제의 예측 오차가 확실히 커졌습니다. 맞는 예시를 더 넣으면 오차가 줄었지만 넣을수록 줄어드는 폭이 작아졌습니다. 연구자들은 이것을 맥락의 끈적임이라 불렀고, 어떤 순서로 훈련했느냐가 회복력을 크게 좌우했다고 보고합니다 (arXiv:2604.23371, 프리프린트). 그 실험 조건에서는 프롬프트에 무엇을 넣느냐뿐 아니라 이미 무엇을 넣어 두었느냐가 뒤따르는 답을 흐릴 수 있었습니다.

모델이 무엇을 배웠는지 들여다보기 — 프로빙의 한계

「신경망과 파라미터」는 파라미터가 함께 무엇을 하는지 사람이 다 읽어 낼 수 없고, 속을 들여다보는 도구는 아직 완성되지 않았다고 적었습니다. 언어모델에서 그 도구의 하나가 프로빙입니다. 프로빙은 모델이 입력을 처리하며 안쪽 층에 만들어 내는 숫자들, 곧 표현을 따로 떼어 와서, 거기에 어떤 정보가 담겼는지 작은 모델로 맞혀 보는 방법입니다.

모델이 겉으로 보이는 행동과 안쪽 표현이 따로 놀 수 있다는 것을 보여 준 연구가 있습니다. 무작위 정답으로 미세조정해 특정 과제를 「잊게」 만든 언어모델을 조사했더니, 잊는 정도가 과제마다 극단적으로 달랐습니다. 어떤 과제에서는 처음 보는 문제에도 의미 없는 답을 냈지만, 물리 상식 추론이나 과학 질의응답 같은 과제에서는 잊게 한 예제에만 영향이 갔고, 그와 아주 비슷한 새 문제는 여전히 정확하게 풀었습니다. 그리고 넓게 일반화된 망각조차 얕았습니다. 망각 뒤에도 그 모델의 표현 위에 학습한 선형 프로브, 곧 가장 단순한 직선 꼴 계산으로 된 프로브는 그 과제를 여전히 해냈습니다. 저자들은 이 결과가 미세조정으로 특정 기술만 골라 지우기가 어렵고 예측하기 힘들다는 것을 보여 준다고 적습니다 (arXiv:2409.02228, 프리프린트).

행동과 표현은 어긋날 수 있습니다. 모델이 어떤 일을 못 하는 것처럼 행동한다고 해서 그 정보가 안에 없는 것은 아닙니다. 거꾸로 생각하면, 프로브가 무언가를 읽어 낸다고 해서 모델이 그것을 실제로 쓰고 있다고 곧바로 말할 수도 없습니다. 앞에서 본 맥락 내 학습 이론의 연구는 통제한 작은 실험 환경에서 학습한 트랜스포머를 프로빙해, 맥락 내 학습을 입력의 조합 구조에 대한 표현이 받치고 있음을 보였습니다 (arXiv:2303.07971). 이런 결과도 그 환경에서 프로브가 읽어 낸 것으로 읽습니다.

더 강한 방법은 학습 데이터를 직접 바꾸는 것입니다. 영어 수동태의 예외를 언어모델이 어떻게 배우는지 다룬 연구는, 가설이 지목하는 유형의 문장을 학습 말뭉치에서 빼고 바꾸고 넣어 가며 답을 좁혔습니다. 저자들은 학습자가 받는 입력을 완전히 통제하는 일이 이런 물음에 결정적이라는 방법론적 교훈을 남겼습니다 (arXiv:2407.04593, 프리프린트). 이 방법은 학습을 처음부터 다시 돌릴 수 있어야 쓸 수 있습니다. 학습 말뭉치도 학습 절차도 공개되지 않은 모델에는 적용할 수 없다는 뜻입니다.

창발은 판정할 수 있는가

「신경망과 파라미터」는 창발 능력을 작은 모델에는 없고 큰 모델에는 있는 능력이라 정의하고, 두 주장을 나란히 놓았습니다. 그런 능력은 작은 모델의 성적을 이어 그어서는 예측할 수 없다는 2022년 주장과 (arXiv:2206.07682, 프리프린트), 창발처럼 보이는 것이 연구자가 고른 채점 잣대에서 생길 수 있다는 2023년 반론입니다 (arXiv:2304.15004, 프리프린트).

그 뒤에도 설명이 더 나왔습니다. 같은 2023년에 나온 한 이론은, 창발이라 불린 능력이 맥락 내 학습과 모델의 기억과 언어 지식이 합쳐진 결과이고 진짜 창발이 아니라고 결론지었습니다. 이 이론은 1,000회가 넘는 실험과 함께 제시됐습니다 (arXiv:2309.01809, 프리프린트). 2025년에 이 현상을 폭넓게 검토한 개관은 기존 정의들을 따져 보며 개념을 세우는 방식부터 서로 어긋난다는 것을 드러냈습니다. 결론은 조심스럽습니다. 창발 능력은 여전히 잘 이해되지 않았고, 그 정의와 본질, 예측 가능성과 함의에 대한 오해를 낳고 있다는 것입니다 (arXiv:2503.05788, 프리프린트).

다툼의 모양을 정리하면 이렇습니다. 지표를 문제 삼은 반론은 창발이 모델을 키우는 일의 근본 성질이 아닐 수도 있다는 데서 멈췄고, 조합으로 설명한 이론은 주장된 창발이 진짜 창발이 아니라고까지 갔습니다. 개관은 아직 잘 모른다고 정리합니다. 어느 쪽이든 판정은 무엇으로 어떻게 쟀느냐에 걸려 있습니다. 「이 크기에서 이 능력이 생겼다」는 문장은 무슨 지표와 어떤 프롬프트로 쟀는지 확인하기 전에는 그대로 받아들이기 어렵습니다.

이 기계는 무엇의 모형인가

가장 근본적인 자리도 비어 있습니다. 한쪽에는 언어모델이 언어를 쓰는 법을 배웠다는 것을 인정하면 언어과학에 돌파구가 열릴 수 있다는 관점이 있습니다. 그 대가로 언어 지식을 평가하는 오래된 생각 일부를 버려야 할 수 있다고 함께 적습니다 (arXiv:2512.12447, 프리프린트).

다른 쪽에는 트랜스포머가 사람의 능력에 대한 모형이 아니라 우리가 학습시킨 말뭉치에 대한 모형이라는 논증이 있습니다. 인지과학은 사람의 언어 능력이 선형보다 강한 계산 형식에 기댄다고 보는데, 트랜스포머 구조는 기껏해야 선형 형식을 지지한다는 것입니다. 저자는 이것이 그리 비관적인 이야기가 아니라고 덧붙입니다. 언어는 속마음을 표현하는 수단이면서, 알맞은 맥락이 주어지면 새 말을 만들어 내는 일종의 「담화 기계」이기도 하고, 우리가 이 기술을 한 방식으로 쓰는 법을 배웠듯 언어모델도 아주 다른 방식으로 그것을 쓰는 법을 배웠다는 것입니다 (arXiv:2508.18598, 프리프린트).

두 관점은 같은 자료를 보고 다른 결론에 이릅니다. 어느 쪽이 옳은지는 이 글이 정할 수 없습니다. 다만 어느 쪽을 택하든 그 선택은 논증의 결과이고, 관측이 정해 준 답은 아직 없습니다.

논문을 열 때 확인할 네 가지

  • 어떤 모델을 쟀는지 봅니다. 사전학습만 마친 모델인지, 지시학습과 정렬을 거친 모델인지에 따라 결과가 달라집니다.
  • 무엇을 쟀는지 봅니다. 손실인지 하류 과제의 성적인지, 그 지표가 연속으로 변하는지 뚝 끊기는지를 확인합니다.
  • 규모의 축을 봅니다. 파라미터만 늘렸는지, 데이터도 늘렸는지, 계산 예산을 일정하게 묶었는지를 확인합니다.
  • 프롬프트가 통제됐는지 봅니다. 맥락 내 학습과 사고연쇄가 결과에 섞여 들어오지 않았는지를 확인합니다.

어디를 더 볼까

딥러닝이 트랜스포머에 이르기까지의 역사는 「역전파에서 알파폴드까지 — 딥러닝은 무엇을 딛고 올라섰나」에 있습니다. 그럴듯하지만 틀린 대답이 왜 나오는지는 「LLM은 왜 '거짓말'을 하는가」에서 이어집니다. 이 기계가 이해하거나 생각한다고 말할 수 있는지는 「AI는 정말 '생각'하는가 — 아직 학계가 다투는 중인 질문」이 다룹니다. 맥락 내 학습과 사고연쇄가 실제 쓰임에서 얼마나 효과가 있는지는 「프롬프트가 진짜 효과 있나 — AI에게 잘 묻는 법의 과학」에서, 지표가 결론을 바꾸는 문제는 「점수는 올랐다. 그런데 무엇이 올랐나」에서 볼 수 있습니다.

근거 논문

  • "Distributed Representations of Words and Phrases and their Compositionality" (2013, 프리프린트) — DOI: 10.48550/arxiv.1310.4546 — 단어의 분산 벡터 표현, 부분표집·부정 표집, 그리고 "어순에 무관심하고 관용구를 표현하지 못한다"는 자기 한계.
  • "Attention Is All You Need" (2017) — DOI: 10.65215/2q58a426 — 순환·합성곱을 완전히 배제하고 어텐션만으로 된 구조, 병렬화와 학습 시간 절감.
  • "Language Models are Few-Shot Learners" (2020, 프리프린트) — DOI: 10.48550/arxiv.2005.14165 — 그래디언트 갱신·미세조정 없이 텍스트 상호작용만으로 지정한 few-shot, 그리고 여전히 고전하는 데이터셋과 웹 말뭉치 학습의 방법론적 문제에 대한 자기 지적.
  • "Scaling Laws for Neural Language Models" (2020, 프리프린트) — arXiv:2001.08361 — 손실이 모델·데이터·계산에 대해 거듭제곱으로 스케일, 폭·깊이의 효과는 미미, 고정 예산의 최적 배분.
  • "Training Compute-Optimal Large Language Models" (2022, 프리프린트) — arXiv:2203.15556 — 당시 대형 모델의 과소학습, 모델 크기와 토큰 수를 동등하게 늘려야 한다는 수정.
  • "Training language models to follow instructions with human feedback" (2022, 프리프린트) — arXiv:2203.02155 — 정렬 문제의 정식화, 지시 미세조정 + RLHF, 100배 작은 모델의 출력이 선호됨, 그러나 여전한 단순 실수.
  • "Emergent Abilities of Large Language Models" (2022, 프리프린트) — arXiv:2206.07682 — 창발의 정의와 예측 불가능성 주장.
  • "Are Emergent Abilities of Large Language Models a Mirage?" (2023, 프리프린트) — arXiv:2304.15004 — 창발이 지표 선택의 산물일 수 있다는 대안 설명과 세 갈래 검증.
  • "Are Emergent Abilities in Large Language Models just In-Context Learning?" (2023, 프리프린트) — arXiv:2309.01809 — 맥락 내 학습·기억·언어 지식의 조합으로 설명, 1,000회 이상 실험.
  • "Emergent Abilities in Large Language Models: A Survey" (2025, 프리프린트) — arXiv:2503.05788 — 정의의 불일치, 조건 평가, 여전히 잘 이해되지 않았다는 결론.
  • "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models" (2022, 프리프린트) — arXiv:2201.11903 — 중간 추론 단계 시연을 예시로 준 프롬프팅, 산술·상식·상징 추론 개선.
  • "A Theory of Emergent In-Context Learning as Implicit Structure Induction" (2023, 프리프린트) — arXiv:2303.07971 — 구성적 구조 재조합, 일반 다음 토큰 예측에서 맥락 내 학습이 나온다는 정보이론적 상계, 프로빙으로 확인된 구성 구조 표상.
  • "Toward Understanding In-context vs. In-weight Learning" (2024, 프리프린트) — arXiv:2410.23042 — 맥락 내 학습의 출현과 소멸을 낳는 분포적 성질, 게이팅 모형의 이론 분석.
  • "When Context Sticks: Studying Interference in In-Context Learning" (2026, 프리프린트) — arXiv:2604.23371 — 앞선 예시가 뒤의 과제 적응을 방해하는 맥락의 끈적임.
  • "Tokenization Falling Short: On Subword Robustness in Large Language Models" (2024, 프리프린트) — arXiv:2406.11687 — "토큰화의 저주", 오타·형식 변동 편향, 규모로도 남는 취약함.
  • "Language Model Tokenizers Introduce Unfairness Between Languages" (2023, 프리프린트) — arXiv:2305.15425 — 언어별 최대 15배 토큰 길이 격차와 비용·지연·맥락 분량의 불평등.
  • "Evaluating Morphological Alignment of Tokenizers in 70 Languages" (2025, 프리프린트) — arXiv:2507.06378 — 형태론적 정렬이 성능 분산을 별로 설명하지 못함.
  • "Leading Whitespaces of Language Models' Subword Vocabulary Pose a Confound for Calculating Word Probabilities" (2024, 프리프린트) — arXiv:2406.10851 — 앞선 공백 때문에 단어 확률의 합이 1을 넘을 수 있음.
  • "Language models are better than humans at next-token prediction" (2022, 프리프린트) — arXiv:2212.11281 — 최상위 정확도와 혼란도 두 실험에서 사람이 일관되게 나빴음.
  • "Self-Attention as Distributional Projection" (2025, 프리프린트) — arXiv:2511.13780 — 말뭉치 공기 통계의 시퀀스 맥락 투영으로 자기어텐션을 해석.
  • "Found in the Middle: Calibrating Positional Attention Bias Improves Long Context Utilization" (2024, 프리프린트) — arXiv:2406.16008 — 관련성과 무관한 U자형 위치 편향과 중간 정보 누락.
  • "Relative-Based Scaling Law for Neural Language Models" (2025, 프리프린트) — arXiv:2510.20387 — 교차엔트로피가 놓치는 상대 순서를 지표로 삼은 규모 법칙.
  • "Scaling Laws for Downstream Task Performance of Large Language Models" (2024, 프리프린트) — arXiv:2402.04177 — 분포 불일치 시 하류 지표가 나빠지는 동안에도 하류 교차엔트로피는 개선.
  • "On the origin of neural scaling laws: from random graphs to natural language" (2026, 프리프린트) — arXiv:2601.10684 — 데이터에 거듭제곱 구조가 없어도 규모 법칙이 나타남.
  • "A Survey of Reinforcement Learning from Human Feedback" (2023, 프리프린트) — arXiv:2312.14925 — RLHF의 기초, 선호 기반 강화학습이라는 뿌리, 제어·로보틱스 기법.
  • "Humans are not Boltzmann Distributions" (2022, 프리프린트) — arXiv:2206.13316 — 편향 없는 합리적 피드백이라는 가정의 단순함, 개인적·맥락적·동적 사람 모형의 필요.
  • "Reinforcement Learning from Human Feedback: Whose Culture, Whose Values, Whose Perspectives?" (2024, 프리프린트) — arXiv:2407.17482 — RLHF에서 다원주의의 인식론적·윤리적 논거.
  • "Demystifying Instruction Mixing for Fine-tuning Large Language Models" (2023, 프리프린트) — arXiv:2312.10793 — 지시 유형 조합이 응용마다 상반된 효과를 낼 수 있음.
  • "Detecting Mode Collapse in Language Models via Narration" (2024, 프리프린트) — arXiv:2402.04477 — 4,374편 분석, 정렬 과적합이 저자성 일반화를 제약.
  • "Unforgettable Generalization in Language Models" (2024, 프리프린트) — arXiv:2409.02228 — 망각의 과제별 극단적 편차, 그리고 망각 후에도 선형 프로브가 과제를 수행한다는 결과.
  • "Manipulating language models' training data to study syntactic constraint learning" (2024, 프리프린트) — arXiv:2407.04593 — 학습 말뭉치 조작으로 가설을 가르는 방법론.
  • "Large language models have learned to use language" (2025, 프리프린트) — arXiv:2512.12447 — 언어 사용 학습의 인정이 언어과학에 여는 가능성과 그 대가.
  • "What do language models model? Transformers, automata, and the format of thought" (2025, 프리프린트) — arXiv:2508.18598 — 트랜스포머는 인간 능력이 아니라 말뭉치의 모형이라는 논증과 '담화 기계'로서의 언어.

🏛️ 이 글의 뿌리가 된 논문

이 글이 근거로 삼은 논문 중 ‘거인의 어깨’에 오른 초석 연구예요. 개념을 익혔다면 원전으로 가보세요.

  • Distributed Representations of Words and Phrases and their Compositionality2013

    워드 임베딩 개념을 대중화하여 의미적 단어 표현의 기초를 정립했습니다.

    이 분야의 거인의 어깨 →
  • Attention Is All You Need2017

    기존의 순환 신경망을 대체하는 트랜스포머 아키텍처를 제시하여 현대 딥러닝과 생성형 AI의 시대를 열었습니다.

    이 분야의 거인의 어깨 →
  • Language Models are Few-Shot Learners2020

    GPT-3를 통해 거대 언어 모델이 별도의 학습 없이도 다양한 작업을 수행할 수 있음을 입증했습니다.

    이 분야의 거인의 어깨 →
📚 인공지능과 언어모델 1부 — 말하는 기계를 재는 법
2 / 6
  1. 1.역전파에서 알파폴드까지 — 딥러닝은 무엇을 딛고 올라섰나
  2. 2.다음 낱말을 맞히는 훈련이 어떻게 대화가 되는가 — 언어모델을 읽기 위한 최소 토대
  3. 3.LLM은 왜 '거짓말'을 하는가 — 환각은 어디서 생기고, 줄이는 방법은 어디까지 듣는가
  4. 4.AI는 정말 '생각'하는가 — 아직 학계가 다투는 중인 질문
  5. 5.프롬프트가 진짜 효과 있나 — AI에게 잘 묻는 법의 과학
  6. 6.점수는 올랐다. 그런데 무엇이 올랐나
← 이전 글역전파에서 알파폴드까지 — 딥러닝은 무엇을 딛고 올라섰나다음 글 →LLM은 왜 '거짓말'을 하는가 — 환각은 어디서 생기고, 줄이는 방법은 어디까지 듣는가

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.