Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장

토큰, 다음 토큰의 확률, 그리고 뽑기. 같은 질문에 답이 달라지는 까닭에서 출발하는 첫걸음

🌱첫걸음✦AI 생성컴퓨터과학·AI · 2026년 10월 3일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장

같은 질문을 두 번 넣으면

점심시간에 챗봇 창을 열고 「퇴근길에 들을 만한 이야기를 하나 추천해 줘」라고 적어 봅니다. 몇 줄짜리 추천이 곧바로 돌아옵니다. 같은 문장을 새 창에 한 번 더 넣으면 이번에는 추천하는 이야기도 말투도 조금 다른 대답이 나옵니다. 둘 다 멀쩡한 문장인데, 같은 문장은 아닙니다.

휴대폰 자판에서도 비슷한 것을 매일 봅니다. 「오늘 저녁」까지 치면 자판 위에 다음에 올 만한 말이 몇 개 뜹니다. 그중 하나를 누르면 그 말이 붙고, 곧바로 그다음 추천이 뜹니다. 자판은 앞에 친 말을 보고 뒤에 올 말을 짐작합니다.

챗봇의 대답도 같은 방향의 일을 되풀이해서 만들어집니다. 앞에 놓인 글을 보고 다음 조각을 하나 고르고, 그 조각을 붙인 다음 다시 고릅니다. 자판과 다른 점은 셋입니다. 자판은 대개 바로 앞에 친 몇 마디를 보고 짐작하지만, 챗봇은 대화창에 놓인 앞글을 한꺼번에 살핍니다. 자판은 후보를 보여 주고 사람이 고르지만, 챗봇은 고르는 일까지 스스로 합니다. 그리고 챗봇은 흔히 고를 때 약간의 뽑기를 섞습니다. 점심시간의 두 대답이 달라진 주된 까닭이 이 뽑기에 있습니다.

이어지는 절은 이 과정을 순서대로 따라갑니다. 글을 조각으로 자르고, 다음 조각의 확률을 매기고, 그중 하나를 뽑습니다. 그다음에는 그렇게 할 줄 알게 되기까지의 연습과, 앞글에서 어디를 볼지 정하는 구조를 봅니다. 마지막에는 점심시간의 질문 하나가 대답이 되기까지를 처음부터 끝까지 따라갑니다.

글을 조각으로 자른다

「퇴근길에 들을 만한 이야기를 하나 추천해 줘」라는 문장이 챗봇에 들어가면 가장 먼저 잘게 잘립니다. 자르는 쪽이 무엇인지부터 이름을 붙이겠습니다.

인공지능은 사람이 지능을 써서 하던 일을 컴퓨터가 해내게 하려는 기술을 두루 부르는 말입니다. 그 가운데 생성형 AI는 글이나 그림처럼 새로운 내용을 만들어 내는 인공지능입니다. 그림을 만드는 쪽에는 이 글과 다른 계열의 방법도 쓰이고, 그중 한 계열은 그림과 영상 만들기에서 기록적인 성능을 냈습니다 (DOI: 10.1145/3626235). 여기서는 글을 만드는 쪽만 봅니다.

모델은 입력을 받아 출력을 내는 계산 장치로, 그 안의 숫자들을 조정해 원하는 답에 가깝게 만들 수 있습니다. 챗봇 안에서 대답을 만드는 것은 글을 다루는 모델입니다. 언어 모델은 글을 받아 그 뒤에 이어질 글을 내놓는 모델입니다.

언어 모델에 들어가는 글은 먼저 토큰으로 잘립니다. 토큰은 언어 모델이 글을 잘라 다루는 단위로, 낱말 하나일 때도 있고 낱말의 한 조각이나 문장부호일 때도 있습니다. 자주 쓰이는 낱말은 통째로 한 토큰이 되기 쉽고, 드문 낱말은 더 작은 조각 몇 개로 나뉩니다. 이렇게 자르면 처음 보는 낱말이나 드문 이름도 아는 조각을 이어서 적을 수 있습니다 (arXiv:1508.07909, arXiv에 공개된 프리프린트 판 — 동료심사를 거치기 전 올라온 판). 「퇴근길」이 한 토큰이 될지, 「퇴근」과 「길」 둘이 될지, 한글 한 글자보다도 잘게 쪼개질지는 모델마다 미리 정해 둔 자르는 법에 달려 있습니다.

잘린 토큰은 모델 안에서 계산할 수 있는 숫자로 바뀌어 들어갑니다 (DOI: 10.17721/2706-9699.2025.1.06). 그래서 모델에게 점심시간의 부탁은 토큰이 한 줄로 늘어선 것입니다. 이 줄이 다음 절의 출발점입니다.

다음 토큰의 확률을 매긴다

「비가 와서 우산을」 다음에 올 말을 떠올리면 「챙겼다」나 「썼다」가 먼저 떠오르고, 「먹었다」는 거의 떠오르지 않습니다. 언어 모델은 같은 일을 숫자로 합니다.

「비가 와서 우산을」 다음에 올 토큰 후보마다 확률을 막대로 그린 그림. 챙겼다와 썼다가 길고, 폈다와 샀다가 짧으며, 먹었다는 거의 보이지 않는다.

다음 토큰 예측은 앞에 놓인 토큰들을 보고 바로 다음에 올 토큰이 무엇일지 후보마다 확률을 매기는 일입니다. 후보는 모델이 아는 토큰 전부이고, 한 걸음마다 그 전부에 확률이 하나씩 붙습니다 (DOI: 10.48550/arxiv.2407.01082, arXiv에 공개된 프리프린트 판). 「챙겼다」 쪽에는 높은 확률이, 「먹었다」 쪽에는 0에 가까운 확률이 붙는 식입니다.

대답은 이 일을 되풀이해서 만들어집니다. 다음 토큰을 하나 정해 줄 끝에 붙이고, 늘어난 줄 전체를 다시 앞글로 삼아 그다음 토큰의 확률을 매깁니다. 자기가 방금 만든 것을 다시 입력으로 삼아 한 조각씩 이어 가는 이 방식이 큰 언어 모델이 글을 만드는 기본 틀입니다 (DOI: 10.17721/2706-9699.2025.1.06). 챗봇 속 언어 모델은 다음 토큰 하나를 골라 붙이는 일을 대답이 끝날 때까지 되풀이해서 대답을 만듭니다.

세 줄. 첫 줄은 비가·와서·우산을 뒤에 다음 토큰을 묻는 빈칸이 있고, 둘째 줄은 챙겼다가 붙은 줄 전체가 다시 앞글이 되며, 셋째 줄은 마침표가 붙는다. 새로 붙은 조각이 붉게 표시되어 있다.

처음 장면의 자판 추천과 같은 방향의 일입니다. 다만 이 틀에서는 대답의 앞쪽 조각이 곧 뒤쪽 조각의 앞글이 됩니다. 앞에서 한 조각이 달라지면 그 뒤에 매겨지는 확률도 달라집니다.

같은 질문에 답이 달라지는 이유

「우산을」 뒤의 후보마다 확률이 매겨졌다면, 이제 그중 하나를 정해야 합니다. 가장 쉬운 방법은 늘 확률이 가장 높은 1등 후보를 고르는 것입니다.

긴 글을 자유롭게 이어 쓰게 할 때 늘 1등만 고르면, 글이 밋밋해지고 같은 말을 이상하게 되풀이하는 쪽으로 흐르기 쉽다는 것이 2019년 연구에서 드러났고, 뒤의 연구들도 끝이 열린 글에서 같은 문제를 다룹니다 (arXiv:1904.09751, arXiv에 공개된 프리프린트 판; DOI: 10.18653/v1/2023.findings-acl.262). 정답이 하나로 뚜렷한 짧은 답에서는 1등만 고르는 방식도 흔히 쓰입니다. 같은 모델이라도 다음 토큰을 고르는 방법만 바꾸면 만들어지는 글의 질이 크게 달라집니다 (arXiv:1904.09751). 확률을 매기는 일과 하나를 고르는 일은 따로 있고, 뒤의 것이 글의 모양을 크게 바꿉니다.

그래서 언어 모델은 흔히 확률에 따라 뽑습니다 (DOI: 10.48550/arxiv.2407.01082). 샘플링은 매겨진 확률에 따라 후보 가운데 하나를 뽑는 일입니다. 확률이 높은 후보는 자주 뽑히고, 낮은 후보도 가끔은 뽑힙니다. 같은 질문에 답이 달라지는 주된 까닭은 이 뽑기가 대답을 만드는 절차 안에 들어 있다는 데 있습니다. 앞에서 뽑힌 조각이 뒤의 앞글이 되므로, 한 걸음의 차이가 뒤로 가며 다른 문장으로 번질 수 있습니다.

뽑기를 얼마나 대담하게 할지도 정할 수 있습니다. 온도는 언어 모델이 다음 토큰을 뽑을 때 확률이 낮은 후보까지 얼마나 과감하게 고를지를 정하는 설정값입니다. 온도를 낮출수록 확률이 높은 후보 쪽으로 몫이 더 쏠려 1등이 더 자주 뽑히고 대답도 덜 흔들립니다. 끝까지 낮추면 사실상 1등만 고르는 것과 같아집니다. 온도를 높일수록 몫이 고르게 펴져 확률이 낮던 후보가 더 자주 뽑힙니다. 자판에 빗대면, 온도가 낮은 쪽은 거의 늘 맨 앞 추천을 누르는 사람이고 온도가 높은 쪽은 뒤쪽 추천도 자주 누르는 사람입니다. 온도는 모델이 매긴 확률표를 뽑기 직전에 고쳐 쓰는 설정이라, 모델 안의 숫자는 그대로 둡니다. 보통은 서비스를 만드는 쪽이 정해 둡니다.

같은 후보 확률을 두 온도로 고쳐 쓴 막대그래프. 온도가 낮은 쪽은 1등 후보로 몫이 쏠리고, 온도가 높은 쪽은 몫이 고르게 펴진다.

어느 쪽 끝도 좋지만은 않습니다. 확률이 높은 후보부터 일정 몫까지만 남기고 뽑는 흔한 방법을 쓸 때, 온도를 많이 올리면 앞뒤가 안 맞는 글이나 같은 말을 되풀이하는 글이 나오기 쉽습니다 (DOI: 10.48550/arxiv.2407.01082). 1등만 고르는 쪽은 앞에서 본 대로 긴 글에서 밋밋해지기 쉽습니다. 뽑기를 넓히면 대답이 다양해지는 대신 질이 떨어지기 쉬운 이 맞바꿈을 줄이는 것이 여러 고르기 방법의 목표입니다 (DOI: 10.18653/v1/2023.findings-acl.262).

흔히 쓰는 방법은 온도를 조절하면서, 확률이 아주 낮은 꼬리 쪽 후보를 잘라 내고 남은 후보 안에서만 뽑는 것입니다 (DOI: 10.18653/v1/2025.acl-long.1278). 믿기 어려운 꼬리를 잘라 낸 쪽이 다양함을 높이면서도 매끄러움과 앞뒤 맞음을 잃지 않았습니다 (arXiv:1904.09751). 이런 방법들의 결과는 고른 설정값에 크게 달려 있어서, 어떤 방법과 설정값을 고를지 가리는 방법 자체가 연구되고 있습니다 (DOI: 10.18653/v1/2025.acl-long.1278).

자동완성 연습을 엄청나게 많이

앞 절의 확률표에서 「챙겼다」가 높고 「먹었다」가 낮은 것은 모델이 그만큼 많은 글을 미리 거쳤기 때문입니다. 2023년에 공개된 LLaMA 모델들은 공개된 데이터만으로 조 단위의 토큰을 재료로 삼았습니다 (DOI: 10.48550/arxiv.2302.13971, arXiv에 공개된 프리프린트 판).

그 재료로 하는 일에 붙은 이름이 학습입니다. 학습은 예시 데이터나 경험에 맞춰 모델 안의 숫자들을 조금씩 고쳐 가는 과정으로, 훈련이라고도 부릅니다. 고쳐지는 숫자에도 이름이 있습니다. 파라미터는 모델 안에서 학습으로 정해지는 숫자들로, 모델이 입력을 어떻게 계산해 답을 내는지가 이 숫자들로 정해집니다. 2020년에 나온 GPT-3는 이런 숫자를 1,750억 개 가졌습니다 (DOI: 10.48550/arxiv.2005.14165, arXiv에 공개된 프리프린트 판). 숫자들을 어떻게 조금씩 옮기는지, 크게 만들면 무엇이 달라지는지는 이 시리즈의 다른 편 「신경망과 파라미터」에서 다룹니다.

사전학습은 엄청난 양의 글에서 다음 토큰 맞히기를 되풀이하며 파라미터를 맞춰 가는 첫 단계의 학습입니다. 이 연습에는 사람이 정답을 따로 달아 줄 필요가 없습니다. 문장의 앞부분을 보여 주고 다음 토큰을 맞히게 하면, 정답은 그 문장에 이미 적혀 있는 바로 다음 토큰입니다. 글 스스로 문제와 답을 내주니 연습할 글이 넉넉하고, 이 연습 하나가 여러 쓰임에 두루 쓰이는 바탕이 됩니다 (DOI: 10.1145/3605943). 큰 언어 모델의 기본 능력은 이렇게 사람이 답을 달지 않은 글로 하는 큰 규모의 학습에서 세워집니다 (DOI: 10.1007/s11704-026-60308-3). 자판의 자동완성에 빗대면, 엄청난 양의 글로 다음 말 맞히기를 연습하는 단계입니다.

이 연습만으로는 묻는 말에 늘 알맞게 답하는 상대가 되지 않습니다. 모델을 크게 만든다고 사용자가 원하는 바를 저절로 더 잘 따르게 되지는 않고, 큰 모델도 사실이 아니거나 해롭거나 도움이 안 되는 글을 내놓을 수 있습니다 (arXiv:2203.02155, arXiv에 공개된 프리프린트 판). 그래서 사전학습 뒤에 다듬는 단계가 붙습니다 (DOI: 10.1007/s11704-026-60308-3).

미세조정은 사전학습을 마친 모델을 골라 모은 예시로 한 번 더 학습시켜, 원하는 방식으로 답하게 다듬는 일입니다. 다듬고 나면 다음 토큰의 확률표 자체가 달라집니다. 사람이 여러 부탁에 바람직한 대답을 직접 써서 보여 주고, 모델이 그 대답을 따라 하도록 학습시키는 식입니다 (arXiv:2203.02155). 그다음에는 모델이 낸 여러 대답을 사람이 비교해 순위를 매깁니다. 사람 피드백 강화학습은 사람이 매긴 대답의 순위를 신호로 삼아, 사람이 더 낫다고 고를 대답을 내는 쪽으로 모델을 한 번 더 고치는 방법입니다. 흔한 절차에서는 그 순위를 본떠 대답마다 점수를 주는 채점용 모델을 먼저 학습시키고, 그 점수가 높아지는 방향으로 언어 모델을 고칩니다. 강화학습이라는 배우는 방식 자체는 이 시리즈의 다른 편 「AI 모델」에서 다룹니다.

2022년의 한 연구에서, 이렇게 다듬은 13억 개 파라미터 모델의 대답이 그 연구가 모은 부탁들에서 1,750억 개짜리 GPT-3의 대답보다 사람 평가에서 더 선호됐습니다. 진실성은 나아지고 해로운 출력은 줄었습니다. 그래도 저자들은 이 모델이 여전히 단순한 실수를 한다고 적었고, 사람 피드백으로 다듬는 일을 사람의 의도에 맞추는 유망한 방향으로 보았습니다 (arXiv:2203.02155). 사람이 매긴 순위는 사람이 더 낫다고 본 대답을 가리킬 뿐이고, 진실성이 나아진 뒤에도 실수는 남았습니다.

사전학습과 다듬기, 두 단계의 몫을 견줘 본 연구도 있습니다. 2023년의 이 연구는 650억 개 파라미터로 사전학습한 모델을, 강화학습도 사람 순위도 쓰지 않고 골라 모은 부탁과 대답 1,000쌍으로만 미세조정했습니다. 사람이 비교한 평가에서 이 모델이 GPT-4와 같거나 더 낫다고 판정된 경우는 43%였고, 나머지는 GPT-4 쪽이 나았습니다. 저자들은 이를 근거로, 언어 모델이 아는 것은 거의 다 사전학습에서 배우고 좋은 대답을 내는 법은 적은 예시로도 가르칠 수 있다고 해석했습니다 (DOI: 10.48550/arxiv.2305.11206, arXiv에 공개된 프리프린트 판). 한 연구의 해석입니다. 이 연구에서도 적은 예시로 다듬은 모델은 확률표가 달라져 대답하는 모습이 바뀌었습니다.

앞글에서 어디를 볼지 정하는 구조

「민수는 지갑을 식탁에 두고 나왔고, 버스에 타고 나서야 그것이 없다는 걸 알았다.」 이 문장에서 「그것」이 무엇인지는 멀리 앞에 있는 「지갑」이 정합니다. 다음 토큰을 맞히는 데 앞글의 토큰이 모두 똑같이 중요하지는 않고, 때로는 멀리 떨어진 한 곳이 답을 쥐고 있습니다.

어텐션은 입력의 어느 부분에 얼마나 주목할지를 그때그때 계산하는 장치입니다. 트랜스포머는 어텐션을 뼈대로 삼아 짠 모델 구조입니다. 처음 제안될 때는 번역을 위한 구조였고, 앞선 번역 모델들이 쓰던 복잡한 구조를 걷어 내고, 토큰 사이를 잇는 일을 어텐션에만 맡겼습니다. 번역 품질이 더 좋으면서 계산을 여러 곳에 나눠 돌리기 쉬워, 학습 시간도 크게 줄었습니다 (arXiv:1706.03762, arXiv에 공개된 프리프린트 판). 큰 언어 모델은 이 구조를 바탕으로, 각 토큰이 자기보다 앞에 놓인 토큰들을 얼마나 참고할지를 여러 층에 걸쳐 되풀이해 계산한 뒤 다음 토큰의 확률을 매깁니다. 한 번에 볼 수 있는 앞글의 길이에는 한도가 있습니다 (DOI: 10.17721/2706-9699.2025.1.06).

어텐션이 실제로 어디를 향하는지는 BERT라는 큰 모델에서 들여다본 분석이 있습니다. BERT는 글을 이어 쓰는 챗봇 속 모델과 사전학습 방식이 다른 모델이지만, 어텐션을 쓰는 점은 같습니다. 그 안의 여러 어텐션 가운데 일부는 동사의 목적어나 같은 대상을 가리키는 말끼리를, 저자들이 놀랄 만큼 높다고 한 정확도로 짚었습니다. 어떤 어텐션은 문장을 나누는 표시나 정해진 거리의 자리를 보았고, 어떤 것은 문장 전체를 넓게 보았습니다. 저자들은 BERT의 어텐션에 문법 정보가 상당히 담겨 있다고 결론지었습니다 (DOI: 10.18653/v1/w19-4828). 이것을 사람의 이해와 같은 일로 볼지는 이 분석이 답하는 물음 밖에 있습니다. 안쪽 계산의 세부는 이 시리즈의 다른 편 「신경망과 파라미터」로 넘깁니다.

질문 하나가 대답이 되기까지

점심시간의 부탁을 처음부터 끝까지 따라가 보겠습니다.

「퇴근길에 들을 만한 이야기를 하나 추천해 줘」가 들어오면, 문장은 먼저 토큰의 줄이 됩니다. 이 줄을 받는 모델은 엄청난 글로 사전학습을 마친 뒤 대답하는 쪽으로 한 번 더 다듬어진 모델입니다. 사람이 쓴 모범 대답과 사람이 매긴 순위를 쓰는 방식이 그 한 예이고, 다듬는 방법은 모델마다 다릅니다 (DOI: 10.1007/s11704-026-60308-3).

모델은 줄 전체를 보고, 어텐션 계산을 여러 층에 걸쳐 거친 뒤, 대답의 첫 토큰이 될 후보 전부에 확률을 매깁니다. 설정된 온도에 따라 그중 하나가 뽑혀 줄 끝에 붙습니다. 늘어난 줄로 다시 확률을 매기고, 다시 뽑고, 다시 붙입니다. 대답이 끝났다는 표시도 토큰 가운데 하나로 들어 있어서, 그 토큰이 뽑히거나 정해 둔 길이에 닿으면 대답이 멈춥니다. 대답은 이 걸음을 그때까지 되풀이한 결과입니다.

새 창에서 같은 부탁을 넣으면, 모델이 매긴 첫 걸음의 확률표가 같더라도 뽑기가 켜져 있는 한 뽑히는 토큰은 다를 수 있습니다. 한 번 다른 토큰이 뽑히면 그 뒤 걸음의 앞글이 달라지고, 그 뒤로 이어지는 대답도 달라질 수 있습니다. 뽑기를 켠 절차에서 같은 질문에 늘 같은 답을 기대할 수는 없습니다. 반대로 뽑기를 끄고 늘 1등만 고르게 하면(흔히 온도를 0으로 둔다고 부릅니다) 같은 부탁에 거의 같은 대답이 나옵니다.

이 걸음들 어디에도 인터넷을 찾아보는 단계는 없습니다. 기본 절차에서 모델이 쓰는 것은 학습 때 맞춰 둔 파라미터와, 지금 모델 앞에 놓인 글입니다. 모델 앞에 놓인 글에는 대화창의 글에 더해 서비스가 보이지 않게 덧붙인 글도 들어갈 수 있습니다. 검색은 따로 붙이는 장치이고, 그 장치를 붙인 챗봇 서비스도 흔합니다. 미리 관련 문서를 찾아 모델 앞에 놓아 주기도 하고, 모델이 대답하다가 검색을 청하면 바깥 프로그램이 찾아온 글을 줄에 넣어 주기도 합니다. 어느 쪽이든 찾아온 글은 모델 앞에 놓인 글의 일부로 들어갑니다. 검색을 붙인 모델에도 사실이 아닌 내용을 막는 데 남는 한계가 연구되고 있습니다 (DOI: 10.1145/3703155).

뽑히는 토큰은 대개 확률이 높은 쪽입니다. 사전학습만 마친 모델에서 확률이 높다는 것은 배운 글에 비추어 그 자리에 올 법하다는 뜻이고, 다듬은 뒤의 모델에서는 사람이 더 낫다고 고를 법한 쪽으로도 옮겨 가 있습니다. 어느 쪽이든 이렇게 만든 글은 매우 그럴듯할 수 있습니다. 2020년의 GPT-3는 사람 평가자가 사람이 쓴 기사와 가려내기 어려워한 뉴스 기사를 써 냈습니다 (DOI: 10.48550/arxiv.2005.14165). 그럴듯함과 참은 다른 물음입니다. 언어 모델이 그럴듯하지만 사실이 아닌 내용을 만들어 내는 일은 실제로 보고되고 있고 (DOI: 10.1145/3703155), 그 일이 왜 생기고 어떤 종류가 있는지는 이 시리즈의 다른 편 「AI의 오류」에서 다룹니다.

마지막으로 남는 물음이 하나 있습니다. 이 절차가 「이해」인가 하는 물음입니다. 여기서 따라간 것은 대답이 만들어지는 절차이고, 그 절차를 이해라고 부를지는 이 설명만으로 정해지지 않습니다.

어디를 더 볼까

이 글보다 한 층 위의 이야기는 「다음 낱말을 맞히는 훈련이 어떻게 대화가 되는가 — 언어모델을 읽기 위한 최소 토대」에 있습니다. 토큰으로 자르는 방식이 낳는 함정, 모델을 키우면 무엇이 어떻게 좋아지는지, 학습을 다시 하지 않고도 대화창의 예시만으로 달라지는 현상까지 다룹니다.

검색을 붙이는 장치가 무엇을 고치고 무엇을 못 고치는지는 「검색을 붙이면 환각이 사라지는가」에서, 그럴듯하지만 틀린 대답이 왜 나오는지는 「LLM은 왜 '거짓말'을 하는가」에서 이어집니다. 이 절차를 이해나 생각이라고 부를 수 있는지를 둘러싼 논쟁은 「AI는 정말 '생각'하는가」가 다룹니다. 대화창에 무엇을 어떻게 적느냐가 대답을 바꾸는지는 「프롬프트가 진짜 효과 있나」에서 볼 수 있습니다.

같은 시리즈의 다른 편도 이어집니다. 모델과 학습이 무엇인지는 「AI 모델」, 파라미터가 어떻게 맞춰지는지는 「신경망과 파라미터」, 틀림의 여러 종류는 「AI의 오류」에 있습니다.

근거 논문

arXiv 번호나 arXiv DOI로 인용한 글은 arXiv에 공개된 프리프린트 판(동료심사를 거치기 전 올라온 판)이며, 본문에서 처음 인용할 때 표시했다.

  • "Diffusion Models: A Comprehensive Survey of Methods and Applications" (2023) — DOI: 10.1145/3626235 — 확산 모델은 그림 합성·영상 생성·분자 설계에서 기록적 성능을 낸 심층 생성 모델 계열. 효율적 샘플링·가능도 추정·특수 구조 데이터 세 갈래로 연구를 정리.
  • "Neural Machine Translation of Rare Words with Subword Units" (2015, arXiv 프리프린트 판) — arXiv:1508.07909 — 드물거나 처음 보는 낱말을 부분 단어 조각의 줄로 적어 어휘가 열린 번역을 가능하게 함. 바이트 쌍 인코딩 기반 분할 포함, 사전 대체 방식보다 번역 점수 향상.
  • "Principles of Large Language Models (LLM)" (2025) — DOI: 10.17721/2706-9699.2025.1.06 — 자기회귀 다음 토큰 생성, 자기어텐션 트랜스포머, 토큰화·임베딩, 다음 토큰 선택 방법(탐욕·top-k·top-p·온도)과 결과의 무작위성, 일관성과 창의성의 맞바꿈, 문맥 길이 한도를 개관.
  • "Turning Up the Heat: Min-p Sampling for Creative and Coherent LLM Outputs" (2024, arXiv 프리프린트 판) — DOI: 10.48550/arxiv.2407.01082 — 언어 모델은 해독 걸음마다 어휘 전체의 확률 분포에서 다음 토큰을 뽑는다. top-p는 특히 높은 온도에서 앞뒤가 안 맞거나 반복되는 출력을 내며, 1등 토큰 확률에 맞춰 문턱을 조절하는 min-p가 질과 다양성을 함께 높임.
  • "The Curious Case of Neural Text Degeneration" (2019, arXiv 프리프린트 판) — arXiv:1904.09751 — 가능도를 해독 목표로 쓰면 글이 밋밋하고 이상하게 반복된다. 같은 모델에서도 해독 전략만으로 질이 크게 달라지며, 확률 분포의 믿기 어려운 꼬리를 자르는 뉴클리어스 샘플링이 유창성·일관성을 잃지 않고 다양성을 높임.
  • "Follow the Wisdom of the Crowd: Effective Text Generation via Minimum Bayes Risk Decoding" (2023) — DOI: 10.18653/v1/2023.findings-acl.262 — 탐욕·빔 탐색은 퇴화와 다양성 문제를, 온도·top-k·뉴클리어스 샘플링은 다양하나 질이 낮은 출력을 낸다. 이 다양성-질 맞바꿈을 푸는 최소 베이즈 위험 해독 제안.
  • "Balancing Diversity and Risk in LLM Sampling" (2025) — DOI: 10.18653/v1/2025.acl-long.1278 — 샘플링 해독은 온도 조절과 꼬리 자르기로 다양성과 질의 균형을 맞춘다. 결과가 설정값에 크게 달려, 꼬리 자르기 방법의 역량을 체계적으로 추정하고 설정값 선택 지침을 제시.
  • "LLaMA: Open and Efficient Foundation Language Models" (2023, arXiv 프리프린트 판) — DOI: 10.48550/arxiv.2302.13971 — 70억~650억 파라미터 기반 모델을 공개 데이터만으로 조 단위(trillions) 토큰 학습. 130억 모델이 대부분의 벤치마크에서 GPT-3(1,750억)를 앞섬.
  • "Language Models are Few-Shot Learners" (2020, arXiv 프리프린트 판) — DOI: 10.48550/arxiv.2005.14165 — 대규모 사전학습 후 과제별 미세조정이 일반적이던 시기, 1,750억 파라미터 자기회귀 언어 모델 GPT-3를 미세조정 없이 몇 개 예시로 평가. 일부 데이터셋에서는 여전히 약하고, 사람 평가자가 사람이 쓴 기사와 구별하기 어려운 뉴스 기사를 생성.
  • "Recent Advances in Natural Language Processing via Large Pre-trained Language Models: A Survey" (2023) — DOI: 10.1145/3605943 — 범용 과제로 한 번 배운 표현을 여러 과제에 나눠 쓰는 것이 핵심이고, 자기지도 글이 풍부한 언어 모델링이 그 범용 과제다. 사전학습 후 미세조정·프롬프트·글 생성 접근과 한계를 정리.
  • "A Survey of Large Language Models" (2026) — DOI: 10.1007/s11704-026-60308-3 — 대규모 자기지도 사전학습이 핵심 능력을 세우고, 지도 미세조정과 강화학습을 포함한 사후 학습이 하위 과제 적응·정렬·안전을 높인다. 활용·평가와 열린 과제까지 네 축으로 정리.
  • "Training language models to follow instructions with human feedback" (2022, arXiv 프리프린트 판) — arXiv:2203.02155 — 키운다고 사용자 의도를 더 잘 따르지 않는다. 시연으로 지도 미세조정 → 출력 순위로 사람 피드백 강화학습. 13억 InstructGPT가 1,750억 GPT-3보다 선호되고 진실성 개선·유해 출력 감소, 공개 데이터셋 성능 저하는 작음. 여전히 단순한 실수를 하지만 유망한 방향.
  • "LIMA: Less Is More for Alignment" (2023, arXiv 프리프린트 판) — DOI: 10.48550/arxiv.2305.11206 — 650억 LLaMA를 골라 모은 1,000개 예시로만 미세조정(강화학습·선호 모형 없음). 사람 비교에서 GPT-4와 같거나 낫다고 판정된 경우 43%. 저자 해석: 지식은 거의 사전학습에서 배우고, 좋은 출력을 가르치는 데는 적은 지시 데이터로 충분.
  • "Attention Is All You Need" (2017, arXiv 프리프린트 판) — arXiv:1706.03762 — 순환·합성곱 없이 어텐션만으로 된 트랜스포머. 번역 두 과제에서 질이 더 좋고 병렬화가 쉬우며 학습 시간이 크게 짧음. 구문 분석에도 일반화.
  • "What Does BERT Look at? An Analysis of BERT's Attention" (2019) — DOI: 10.18653/v1/w19-4828 — BERT의 어텐션은 구분 표시·정해진 위치 간격·문장 전체를 보는 패턴을 보이고, 일부는 동사의 목적어·명사의 한정사·같은 대상 지칭과 높은 정확도로 맞는다. 구문 정보가 어텐션에 상당히 담긴다.
  • "A Survey on Hallucination in Large Language Models" (2024) — DOI: 10.1145/3703155 — 언어 모델은 그럴듯하지만 사실이 아닌 내용을 만들어 내는 경향이 있다. 분류·원인·탐지·완화를 정리하고, 검색을 붙인 모델이 이 문제에 맞설 때의 현재 한계를 논의.

🏛️ 이 글의 뿌리가 된 논문

이 글이 근거로 삼은 논문 중 ‘거인의 어깨’에 오른 초석 연구예요. 개념을 익혔다면 원전으로 가보세요.

  • Language Models are Few-Shot Learners2020

    GPT-3를 통해 거대 언어 모델이 별도의 학습 없이도 다양한 작업을 수행할 수 있음을 입증했습니다.

    이 분야의 거인의 어깨 →
📚 AI 첫걸음 — 예시에서 배우고, 이어 붙이고, 틀리는 계산
3 / 4
  1. 1.AI 모델 — 규칙 대신 예시에서 배우는 계산
  2. 2.신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것
  3. 3.생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장
  4. 4.AI의 오류 — 시험장 밖에서 틀리는 수험생
← 이전 글신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것다음 글 →AI의 오류 — 시험장 밖에서 틀리는 수험생

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.