Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것

인공 뉴런은 입력에 가중치를 곱해 더하고 곡선에 통과시키는 작은 계산 단위이고, 그 가중치가 파라미터의 대부분입니다. 층을 여러 겹 쌓아 학습시키는 것이 딥러닝이고, 학습은 손실을 재어 모든 다이얼을 줄어드는 쪽으로 조금씩 돌리는 한 걸음을 수없이 되풀이하는 일입니다. 이름과 여러 착안은 뇌 연구에서 얻었지만 뇌와 같은 방식으로 작동한다는 것은 아직 확인되지 않았고, 크게 만들면 좋아진다는 것은 관찰된 경향이며, 「창발」은 논쟁 중이고, 수천억 개 숫자가 함께 하는 일은 아직 다 읽히지 않습니다.

🌱첫걸음✦AI 생성컴퓨터과학·AI · 2026년 10월 3일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것

스팸함은 무엇을 보고 고를까

아침에 메일함을 열면 광고 메일 몇 통이 이미 스팸함에 들어가 있습니다. 누가 그 메일을 거기로 옮겼을까요. 한 가지 방법은 사람이 규칙을 적는 것입니다. 「'무료'라는 말이 세 번 넘게 나오면 스팸」처럼요. 다른 방법은 스팸과 정상 메일을 아주 많이 보여 주고, 컴퓨터가 둘의 차이에 스스로 맞춰 가게 하는 것입니다.

이 글은 두 번째 방법의 속을 엽니다. 열어 보면 나오는 것은 숫자입니다. 음향 기기 앞에 늘어선 다이얼을 떠올리면 가깝습니다. 다이얼마다 눈금이 있고, 눈금을 어디에 두느냐에 따라 나오는 소리가 달라집니다. 여기서는 다이얼이 사람이 하나하나 셀 엄두가 안 날 만큼 많고, 그 눈금을 손으로 맞추는 사람이 없습니다. 음향 기기와 다른 점도 하나 있습니다. 여기서는 다이얼 하나하나가 맡을 일을 누가 미리 정해 주지 않고, 수많은 다이얼이 함께 움직여 결과를 냅니다.

다이얼 하나는 무엇을 할까요. 누가, 어떻게 돌릴까요. 많이 달면 무엇이 달라질까요. 이 글은 메일 한 통이 이 계산을 한 번 지나가는 길을 따라가며 그 셋에 답합니다.

다이얼 몇 개로 스팸을 가리는 계산

설명을 위해 메일 한 통에서 사람이 세 가지만 뽑아 본다고 합시다. 광고 문구가 몇 번 나오는지, 링크가 몇 개인지, 보낸 사람이 전에 주고받은 적 있는 사람인지입니다. 계산은 이 셋에 숫자를 하나씩 곱해 모두 더하는 데서 시작합니다. 광고 문구에 곱하는 숫자가 크면 광고 문구가 결과를 크게 흔듭니다. 아는 사람 여부에 곱하는 숫자가 음수이면, 아는 사람이 보낸 메일일수록 결과가 내려갑니다.

인공 뉴런 하나의 도식. 광고 문구 수, 링크 수, 아는 사람인가의 세 입력이 각각 가중치(큰 +, +, −)를 지나 한 점에서 더해지고, 정해진 곡선을 거쳐 스팸일 가능성으로 나간다.

가중치는 입력 하나하나를 결과에 얼마나 크게, 어느 방향으로 반영할지 정하는 숫자입니다. 앞에서 말한 다이얼 하나가 가중치 하나입니다. 가중치를 곱해 더한 합에는 따로 둔 기본값 하나를 더합니다. 그 합은 그대로 내보내지 않고 정해 둔 곡선에 한 번 통과시킵니다. 곡선의 한 예는 아주 작은 값을 0 가까이로, 아주 큰 값을 1 가까이로 눌러 주는 모양입니다. 그러면 결과를 「이 메일이 스팸일 가능성」처럼 0과 1 사이의 값으로 읽을 수 있습니다.

이 한 단위에 이름이 있습니다. 인공 뉴런은 여러 입력에 각각 가중치를 곱해 더한 뒤, 그 합을 정해진 곡선에 통과시켜 내보내는 작은 계산 단위입니다. 인공 신경망은 단순한 계산 단위를 아주 많이 서로 이어 붙인 계산 구조입니다. 인공 뉴런과 그 곡선은 이 구조를 배울 때 가장 먼저 나오는 기본 개념입니다 (DOI: 10.1002/9781394269297.ch02).

이제 이 계산 전체를 부르는 말이 필요합니다. 모델은 입력을 받아 출력을 내는 계산 장치로, 그 안의 숫자들을 조정해 원하는 답에 가깝게 만들 수 있습니다. 스팸 가리기에서 입력은 메일이고 출력은 스팸일 가능성입니다. 파라미터는 모델 안에서 학습으로 정해지는 숫자들로, 모델이 입력을 어떻게 계산해 답을 내는지가 이 숫자들로 정해집니다. 학습은 예시 데이터나 경험에 맞춰 모델 안의 숫자들을 조금씩 고쳐 가는 과정으로, 훈련이라고도 부릅니다. 사람이 규칙을 적는 방식과 이렇게 예시로 숫자를 맞추는 방식이 어떻게 다른지는 이 시리즈의 다른 편 「AI 모델」에서 다룹니다.

이 작은 예에서 파라미터는 가중치 셋과 기본값 하나, 모두 네 개입니다. 신경망의 파라미터는 대부분 가중치이고, 이런 기본값 같은 다른 숫자들이 나머지를 이룹니다. 네 숫자는 사람이 정하지 않고 학습이 정합니다. 다이얼은 곱하는 숫자이고, 눈금은 예시가 맞춥니다.

뇌에서 빌린 것과 빌리지 않은 것

인공 뉴런과 인공 신경망이라는 이름은 뇌의 신경세포에서 왔습니다. 오래된 입문서 하나는 이 분야가 생겨난 동기부터 풀면서 생물 신경세포와 인공 계산 모형을 함께 설명합니다 (DOI: 10.1109/2.485891). 초기의 인공 뉴런 모형은 생물 신경세포를 아주 단순하게 옮긴 것이었고, 신경과학의 원리는 이 모형을 비롯해 여러 차례 이 분야에 크게 영향을 줬습니다 (PMID 32477089).

실제 신경세포는 훨씬 복잡하게 그려집니다. 신경세포에는 입력을 받아 모으는 가지와 출력을 내보내는 긴 섬유가 있습니다. 신경과학은 세포막의 전기적 성질, 신호가 섬유를 따라 전해지는 방식, 신호를 쏠지 정하는 부위의 움직임, 세포 사이 연결이 바뀌는 방식을 각각 따로 모형으로 그립니다 (DOI: 10.1142/s0218127492000653). 인공 뉴런이 옮겨 온 것은 그중 「여러 입력을 저마다 다른 세기로 받아 모아 하나를 내보낸다」는 뼈대입니다.

배우는 방식은 견주기가 더 어렵습니다. 세포 사이 연결이 바뀔 수 있다는 것은 앞의 기본 모형에도 들어 있지만 (DOI: 10.1142/s0218127492000653), 그런 변화가 모여 뇌가 어떻게 배우는지는 아직 잘 모릅니다. 한 연구는 뇌의 생물학적 제약을 지키면서 여러 겹의 표현을 배워 내는 학습 규칙이 아직 알려져 있지 않다고 진단했습니다. 같은 연구는 오차 신호를 뒤에서 앞으로 되돌려 보내지 않고 연결 양쪽 세포의 활동에 주로 기대는 규칙을 후보로 제안했고, 그 규칙으로 학습시킨 신경망이 사진·말소리·영상에서 여러 겹의 표현을 쌓는 것을 모의실험으로 보였습니다. 뇌가 실제로 이 규칙을 쓰는지 확인한 연구는 아닙니다. 여기 인용한 것은 arXiv에 공개된 프리프린트 판으로, 동료심사를 거치기 전에 올라온 판입니다 (DOI: 10.48550/arxiv.2010.08262).

신경과학 쪽에서도 인공 신경망을 씁니다. 신경과학자들은 인공 신경망을 복잡한 행동과 신경 활동을 재현해 보는 모형으로 쓰고, 필요하면 구조와 학습 방식을 뇌에 더 가깝게 손보기도 합니다 (PMID 32970997). 한 종설은 뇌도 막대한 예시에 무차별로 맞춰 가는 방식으로 배우는지 묻고, 이런 관점이 심리학과 신경과학의 여러 이론적 가정에 근본적인 도전이 된다고 봅니다 (PMID 32027833). 인공 신경망은 이름을 비롯해 여러 착안을 뇌 연구에서 얻었지만, 뇌와 같은 방식으로 작동한다는 것은 확인되지 않았습니다.

줄을 세우고 겹을 쌓으면

스팸 가리기에서는 입력 셋을 사람이 골랐습니다. 사진 속 고양이를 가리는 일이라면 무엇을 골라 줘야 할까요. 귀 모양이나 수염을 숫자로 적는 규칙은 쉽게 떠오르지 않습니다. 사진을 다루는 대표적인 신경망은 이 고르기를 건너뜁니다. 사람이 특징을 미리 뽑아 주지 않아도 사진 원본을 그대로 받아 다룰 수 있고, 이 점이 사진을 알아보는 성능을 크게 끌어올린 까닭의 하나로 꼽힙니다 (PMID 34383173).

그렇게 하려면 인공 뉴런 여러 개를 줄지어 세웁니다. 층은 앞쪽에서 넘어온 값을 받아 나란히 계산하는 인공 뉴런들의 한 줄입니다. 첫 층은 원본을 받고, 다음 층은 앞 층이 내보낸 값을 받습니다. 딥러닝은 이런 층을 여러 겹 쌓은 인공 신경망을 학습시키는 방법입니다. 「깊다」는 말은 층이 많다는 뜻입니다. 가운데 층들이 무엇을 계산할지는 사람이 정하지 않고, 학습이 가중치를 맞추면서 정해집니다. 세 입력짜리 예에서는 다이얼마다 어느 입력에 곱하는지 보였지만, 가운데 층의 다이얼에는 그런 이름표가 붙지 않습니다.

층을 쌓은 신경망 도식. 왼쪽 세 입력에서 다섯 개씩의 가운데 층 두 줄을 거쳐 오른쪽 출력 하나(스팸일 가능성)로 이어지고, 층 사이의 모든 뉴런이 선으로 연결되어 있다.

여기서 앞 절의 곡선이 제 몫을 합니다. 곡선이 없으면 층마다 하는 일이 곱하고 더하기뿐이라, 층을 아무리 쌓아도 한 층짜리와 같은 계산으로 줄어듭니다. 곡선이 끼어 있어야 층을 쌓는 만큼 더 복잡한 관계를 표현할 수 있습니다. 곡선의 모양은 여러 가지이고, 가운데 층에서는 0보다 작은 값을 0으로 자르는 꺾인 선도 흔히 씁니다. 한 줄로 곧게 뻗지만 않으면 이 역할을 할 수 있습니다.

층을 넓히고 쌓으면 다이얼도 크게 불어납니다. 한 층의 뉴런이 앞 층의 모든 값을 하나씩 받는다고 가정하면, 뉴런 천 개짜리 층 둘 사이에만 가중치가 백만 개 생깁니다. 이때 층마다 뉴런 수를 늘리면 가중치 수는 곱으로 커지고, 층을 하나 더 쌓으면 그 층 몫만큼 더해집니다.

틀린 만큼, 줄어드는 쪽으로

처음 만든 신경망의 다이얼은 아무렇게나 놓여 있습니다. 가중치의 첫 값을 어떻게 놓을지도 학습에서 따로 다루는 문제입니다 (DOI: 10.1002/9781394269297.ch02). 이 상태에서 스팸 메일을 넣으면 신경망은 엉뚱한 값을 냅니다. 이걸 고치려면 먼저 얼마나 틀렸는지를 재야 합니다.

손실은 모델이 낸 답이 정답에서 얼마나 벗어났는지를 숫자 하나로 잰 값입니다. 스팸인 메일에 스팸일 가능성 0.3이라고 답했다면 손실이 크고, 0.95라고 답했다면 작습니다. 학습은 이 손실을 줄이는 일로 짜여 있습니다 (DOI: 10.1002/9781394269297.ch02).

그다음 물음은 어느 다이얼을 어느 쪽으로 돌려야 손실이 줄어드는가입니다. 다이얼 하나를 아주 조금 돌렸을 때 손실이 어느 쪽으로, 얼마나 변하는지를 그 다이얼의 기울기라고 부릅니다. 경사하강법은 파라미터마다의 기울기를 보고, 모든 파라미터를 손실이 줄어드는 쪽으로 조금씩 옮기는 일을 되풀이하는 방법입니다. 한 번에 얼마나 크게 옮길지를 정하는 배율은 사람이 미리 정하는데, 너무 크면 지나치고 너무 작으면 한참 걸립니다. 실제로는 경사하강법을 손본 여러 변형이 쓰이고, 변형마다 강점과 약점이 다릅니다 (DOI: 10.48550/arxiv.1609.04747, arXiv에 공개된 프리프린트 판).

남은 문제는 다이얼이 수십억 개일 때 그 기울기를 어떻게 다 구하느냐입니다. 역전파는 출력에서 잰 손실에서 출발해 거꾸로 거슬러 올라가며, 파라미터 하나하나가 손실에 얼마나 영향을 주는지(기울기)를 계산하는 방법입니다. 역전파는 기울기를 계산하기만 하고, 그 기울기를 받아 다이얼을 실제로 돌리는 것은 경사하강법입니다. 뒤 층에서 계산한 결과를 앞 층이 이어받아 쓰기 때문에, 다이얼을 하나씩 따로 건드려 보는 것보다 훨씬 적은 계산으로 모든 기울기를 한꺼번에 얻습니다. 앞으로 계산해 손실을 재고, 뒤로 거슬러 가며 기울기를 구하고, 그 기울기를 보고 손실이 줄어드는 쪽으로 다이얼을 조금 돌리는 세 걸음이 학습 한 걸음의 골격입니다 (DOI: 10.1002/9781394269297.ch02).

역전파는 뇌에서 그대로 일어나기 어렵다고 여겨집니다. 그래서 뇌에서도 가능할 법한 대안을 찾는 일을 인공 신경망 연구의 근본적인 과제로 보는 연구자들이 있습니다 (DOI: 10.1609/aaai.v33i01.33014651). 손실이 줄었다고 곧 잘 배운 것인지는 또 다른 문제입니다. 외운 것과 배운 것의 차이는 이 시리즈의 다른 편 「AI 모델」에서 다룹니다.

메일 한 통이 지나가는 길

이제 스팸 메일 한 통을 따라가 봅시다. 메일이 첫 층에 들어가면 뉴런마다 가중치를 곱해 더하고 곡선에 통과시킨 값을 다음 층으로 넘깁니다. 이 앞으로 가는 계산이 마지막 층까지 이어지고, 끝에서 「스팸일 가능성 0.3」이 나옵니다.

정답은 스팸입니다. 0.3과 정답 사이의 거리가 손실로 계산됩니다. 이제 역전파가 마지막 층에서 첫 층까지 거슬러 가며 다이얼마다 기울기를 적어 둡니다. 경사하강법이 그 기울기를 받아, 모든 다이얼을 손실이 줄어드는 쪽으로 아주 조금씩 돌립니다. 실제로는 메일 여러 통을 한 묶음으로 넣고, 묶음 전체의 손실을 보고 한꺼번에 돌리는 방식을 흔히 씁니다.

한 걸음에서 다이얼 하나가 움직이는 폭은 아주 작습니다. 다음 묶음이 들어오면 같은 일이 다시 일어나고, 이 한 걸음이 셀 수 없이 되풀이됩니다. 숫자 수십억 개가 조정된다는 것은, 모든 다이얼을 한꺼번에 조금씩 돌리는 한 걸음이 예시 묶음마다 수없이 되풀이된다는 뜻입니다. 가중치 수백만 개를 관찰 수백만 개에 맞춰 이렇게 최적화하는 방식이 현실의 복잡한 상황에서도 버티는 모델을 만들어 냈습니다 (PMID 32027833). 다만 이 과정이 줄이는 것은 보여 준 예시에서의 손실이고, 처음 보는 메일에서도 잘 맞힐지는 따로 확인해야 합니다.

끝없이 이어지는 벽에 작은 다이얼 수천 개가 줄지어 있고, 사다리 위의 사람이 다이얼 하나를 살짝 돌리는 동안 벽 전체의 다이얼들도 저마다 조금씩 돌아간다.

크게 만들면 좋아진다는 관찰

글을 이어 쓰는 신경망 친칠라(Chinchilla)의 파라미터는 700억 개였습니다. 친칠라는 2022년에 발표됐고, 비교 대상이 된 고퍼(Gopher)는 2,800억 개, GPT-3는 1,750억 개였습니다 (arXiv:2203.15556, arXiv에 공개된 프리프린트 판). 이 크기 경쟁 뒤에는 「키우면 좋아진다」는 관찰이 있습니다.

스케일링 법칙은 모델의 크기, 학습 데이터의 양, 학습에 쓴 계산량을 늘릴 때 손실이 얼마나 줄어드는지를 따라가 본 경향입니다. 2020년에 정리된 결과를 보면, 글을 이어 쓰는 신경망의 손실은 세 가지를 늘릴수록 일정한 모양을 그리며 줄었고, 일부 경향은 규모가 천만 배 넘게 달라지는 범위에서 이어졌습니다. 신경망을 넓게 짜느냐 깊게 짜느냐 같은 세부는 넓은 범위에서 영향이 작았고, 큰 모델일수록 같은 양의 데이터로 손실을 더 많이 줄였습니다 (arXiv:2001.08361, arXiv에 공개된 프리프린트 판).

이 모양은 규모를 몇 배로 늘릴 때마다 손실이 거의 같은 비율로 줄어드는 모양입니다. 손실을 다시 같은 비율만큼 줄이려면 규모를 다시 그만큼 몇 배로 키워야 합니다. 여기서 좋아진다는 것은 손실이 줄어든다는 뜻이고, 쓸모 있는 능력이 그만큼 늘었는지는 따로 재야 합니다.

스케일링 법칙은 관찰에서 얻은 경향이고, 무엇을 얼마나 키워야 하는지에 대한 답은 연구마다 달랐습니다. 2020년 결과는 계산량이 정해져 있으면 아주 큰 모델을 비교적 적은 데이터로 학습시키는 쪽이 효율적이라고 봤습니다 (arXiv:2001.08361). 2022년 연구는 7천만 개에서 160억 개 넘는 파라미터까지 400개 넘는 모델을 학습시킨 뒤, 당시의 큰 모델들이 데이터에 비해 충분히 학습되지 않았다고 결론 내렸습니다. 정해진 계산량을 가장 알뜰하게 쓰려면, 모델을 두 배로 키울 때 데이터도 두 배로 늘려야 한다는 것입니다. 이 처방대로 만든 친칠라는 고퍼와 같은 계산량에 파라미터는 4분의 1, 데이터는 4배를 써서, 여러 과제에서 고퍼와 GPT-3를 고르게 앞섰습니다 (arXiv:2203.15556).

경향이 조건에 묶여 있다는 지적도 있습니다. 기계가 만든 글이 학습 데이터에 점점 섞이면 이 경향이 꺾이고, 이미 익힌 기술을 잊는 현상까지 생길 수 있다는 이론입니다. 여기 인용한 것도 arXiv에 공개된 프리프린트 판이고, 산수 과제와 공개된 대형 모델 하나의 글쓰기 실험으로 이론을 확인했습니다 (DOI: 10.48550/arxiv.2402.07043). 크게 만들면 대체로 좋아졌다는 것은 관찰이고, 무조건 좋아진다는 보장은 그 관찰에 들어 있지 않습니다.

능력이 갑자기 튀어나오는가

크기와 능력의 관계에는 더 극적인 주장도 있습니다. 창발 능력은 작은 모델에는 없고 큰 모델에는 있는 능력입니다. 이 개념을 정리한 2022년 연구는, 이런 능력은 작은 모델의 성적을 이어 그어서는 예측할 수 없고, 그렇다면 더 키울 때 능력의 범위가 더 넓어질 수 있다고 봤습니다 (arXiv:2206.07682, arXiv에 공개된 프리프린트 판).

2023년에 반론이 나왔습니다. 반론을 낸 연구는 창발처럼 보이는 현상이 연구자가 고른 채점 잣대 때문에 생길 수 있다는 설명을 내놨습니다. 특정 과제와 모델 계열에서 이미 나온 답을 놓고, 뚝 끊기거나 가파르게 휘는 잣대로 재면 능력이 갑자기 생긴 것처럼 보이고, 연속으로 변하는 잣대로 재면 같은 모델의 성능이 매끄럽고 예측 가능하게 변합니다. 예를 들어 답을 통째로 맞혀야만 점수를 주는 채점은, 조금씩 가까워지던 답을 어느 크기까지 0점 가까이로 적습니다. 이 연구는 GPT-3 계열 모델과, 여러 과제를 모은 한 과제집의 결과를 다시 분석해, 주장된 창발 능력이 잣대를 바꾸거나 통계를 더 잘 내면 사라진다고 보고했고, 사진을 다루는 여러 신경망에서는 잣대만 골라 없던 창발을 만들어 보이기도 했습니다. 결론은 창발이 모델을 키우는 일의 근본 성질이 아닐 수도 있다는 것입니다 (arXiv:2304.15004, arXiv에 공개된 프리프린트 판).

반론의 결론은 「근본 성질이 아닐 수도 있다」에서 멈추고, 창발이 어디에도 없다고 단정하지는 않습니다. 창발은 아직 논쟁 중이고, 능력이 크기에 따라 갑자기 생기는지 잣대 때문에 그렇게 보이는지는 양쪽 근거가 모두 있습니다.

숫자는 다 보이는데 뜻은 읽히지 않는다

이런 모델의 파라미터는 모두 그냥 숫자라서, 모델을 가진 사람은 하나하나 꺼내 볼 수 있습니다. 문제는 숫자 하나하나에 제 몫의 뜻이 따로 붙어 있지 않다는 것입니다. 모델이 하는 일은 수많은 숫자가 함께 만드는 계산 속에 있습니다. 한 종설은 이런 모델이 사람이 알아볼 수 있는 단순한 규칙도, 사람이 알아볼 수 있는 꼴의 세계 표현도 배우지 않는다고 봅니다. 대신 아주 많은 차원의 파라미터 공간에서 예시 사이를 메워 가며 작동한다는 것입니다 (PMID 32027833). 파라미터를 지식을 한 칸씩 넣어 둔 서랍으로 그리는 것은 이 그림과 맞지 않습니다.

그래서 깊은 신경망은 흔히 속이 보이지 않는 상자라고 불립니다. 깊은 신경망은 높은 판별 능력을 얻는 대신 속 표현을 알아보기 어렵다는 대가를 치릅니다 (DOI: 10.1631/fitee.1700808). 해석 가능성은 모델이 왜 그런 답을 냈는지를 사람이 알아들을 수 있는 말로 풀어낼 수 있는 정도입니다. 이 성질은 사람이 그 시스템을 믿을 수 있는가와 이어지고, 알고리즘에 의한 차별 같은 윤리 문제와도 이어집니다 (DOI: 10.1109/tetci.2021.3100641).

속을 들여다보는 연구는 진행 중입니다. 사진을 알아보는 신경망이 「개」라고 답할 때 사진의 어느 부분이 그 답에 크게 작용했는지를 색으로 칠해 보여 주는 방법이 있습니다. 이 그림은 엉뚱해 보이던 오답에 나름의 이유가 있었음을 보여 주고, 학습 데이터의 치우침을 찾는 데도 쓰였습니다. 사람을 대상으로 한 시험에서는, 이 설명을 본 비전문가가 같은 답을 낸 두 신경망 가운데 더 나은 쪽을 가려냈습니다 (DOI: 10.1109/iccv.2017.74).

2018년 시점의 한 개관은 이런 설명들이 표준화되지도, 체계적으로 평가되지도 않았다고 적었습니다 (DOI: 10.1109/dsaa.2018.00018). 2022년의 한 개관은 신경망 속의 표현을 사람이 알아볼 수 있는 개념으로 가려내는 일을 여전히 풀어야 할 큰 과제로 꼽습니다 (DOI: 10.1214/21-ss133). 이 많은 파라미터가 함께 무엇을 하는지 지금은 사람이 다 읽어 낼 수 없고, 속을 들여다보는 도구는 만들어지고 있지만 아직 완성되지 않았습니다.

어디를 더 볼까

  • 크게 만든 신경망이 어떻게 대화하는 프로그램이 되는지는 「다음 낱말을 맞히는 훈련이 어떻게 대화가 되는가 — 언어모델을 읽기 위한 최소 토대」가 한 층 더 깊이 다룹니다. 이 시리즈의 다른 편 「생성형 AI의 대답」을 먼저 읽으면 더 쉽습니다.
  • 역전파가 언제 나와 무엇을 가능하게 했는지, 딥러닝의 역사는 「역전파에서 알파폴드까지 — 딥러닝은 무엇을 딛고 올라섰나」에 있습니다.
  • 인공 신경망이 뇌를 닮았느냐는 물음은 「AI는 정말 '생각'하는가」로 이어집니다.
  • 채점 잣대가 결론을 바꾸는 문제는 「점수는 올랐다. 그런데 무엇이 올랐나」가 다룹니다.
  • 모델을 키우는 데 드는 계산이 전기로 얼마인지는 「AI는 전기를 얼마나 쓰는가」에서 볼 수 있습니다.
  • 학습이 틀리는 방식은 이 시리즈의 다른 편 「AI의 오류」에서 이어집니다.

근거 논문

arXiv 번호와 10.48550 DOI로 적은 것은 arXiv에 공개된 프리프린트 판, 곧 동료심사를 거치기 전에 올라온 판을 인용한 것입니다. 그중 일부는 뒤에 학회나 저널에 실렸을 수 있습니다.

  • "Fundamentals of Deep Learning" (2025, 책의 장) — DOI: 10.1002/9781394269297.ch02 — 뉴런·층·활성화 함수, 순방향·역방향 계산, 오차를 줄이는 손실 함수, 경사하강법·가중치 초기화·학습률 같은 기본 개념.
  • "Artificial neural networks: a tutorial" (1996) — DOI: 10.1109/2.485891 — 인공 신경망은 단순한 처리기를 대량으로 이어 붙인 병렬 시스템. 생물 뉴런과 인공 계산 모형을 나란히 소개.
  • "Crossing the Cleft: Communication Challenges Between Neuroscience and Artificial Intelligence" (2020) — PMID 32477089 — 생물 뉴런의 단순 모형인 퍼셉트론이 인공 신경망에 영향. 두 분야의 우선순위가 갈라져 있다.
  • "TUTORIAL ON NEUROBIOLOGY: FROM SINGLE NEURONS TO BRAIN CHAOS" (1992) — DOI: 10.1142/s0218127492000653 — 신경세포는 수상돌기·축삭을 가지며 막·섬유·방아쇠 부위·시냅스를 각각의 모형으로 기술.
  • "Local plasticity rules can learn deep representations using self-supervised contrastive predictions" (2020, arXiv에 공개된 프리프린트 판) — DOI: 10.48550/arxiv.2010.08262 — 뇌의 학습은 잘 이해되지 않았고, 생물학적 제약을 지키며 깊은 표현을 배우는 규칙은 아직 알려지지 않았다. 층 사이 오차 역전 없이 국소 규칙을 제안, 이 규칙으로 학습한 신경망이 이미지·음성·영상에서 깊은 계층 표현을 만든다.
  • "Artificial Neural Networks for Neuroscientists: A Primer" (2020) — PMID 32970997 — 신경과학이 인공 신경망을 행동·신경 활동 모형으로 쓰며, 구조·학습을 신경생물학에 가깝게 손본다.
  • "Direct Fit to Nature: An Evolutionary Perspective on Biological and Artificial Neural Networks" (2020) — PMID 32027833 — 수백만 가중치를 수백만 관찰에 맞추는 최적화의 힘. 이런 모델은 사람이 읽을 수 있는 단순 규칙을 배우지 않고 고차원 파라미터 공간에서 보간한다. 뇌도 비슷한가는 물음으로 제기.
  • "A primer on deep learning and convolutional neural networks for clinicians" (2021) — PMID 34383173 — 합성곱 신경망은 사전 특징 추출 없이 원자료를 직접 다뤄 컴퓨터 비전의 학습 능력을 크게 높였다.
  • "An overview of gradient descent optimization algorithms" (2016, arXiv에 공개된 프리프린트 판) — DOI: 10.48550/arxiv.1609.04747 — 경사하강법의 여러 변형과 과제, 각 알고리즘의 강점과 약점.
  • "Biologically Motivated Algorithms for Propagating Local Target Representations" (2019) — DOI: 10.1609/aaai.v33i01.33014651 — 역전파의 생물학적으로 그럴듯한 대안을 찾는 일은 인공 신경망 연구의 근본적으로 중요한 과제.
  • "Training Compute-Optimal Large Language Models" (2022, arXiv에 공개된 프리프린트 판) — arXiv:2203.15556 — 7천만~160억 파라미터 400여 모델. 당시 대형 모델은 덜 학습됨, 모델 크기와 데이터는 같은 비율로. 친칠라(700억·데이터 4배)가 고퍼(2,800억)·GPT-3(1,750억) 등을 넓은 과제에서 앞섬.
  • "Scaling Laws for Neural Language Models" (2020, arXiv에 공개된 프리프린트 판) — arXiv:2001.08361 — 손실은 모델 크기·데이터·계산량에 대해 거듭제곱으로 줄고 일부 경향은 7자릿수 넘게 이어짐. 너비·깊이 영향은 작음. 계산량이 정해지면 아주 큰 모델을 비교적 적은 데이터로.
  • "A Tale of Tails: Model Collapse as a Change of Scaling Laws" (2024, arXiv에 공개된 프리프린트 판) — DOI: 10.48550/arxiv.2402.07043 — 합성 데이터가 학습 코퍼스에 섞이면 스케일링이 꺾이거나 기술을 잊는 현상. 이론 + 산수 과제·Llama2 실험.
  • "Emergent Abilities of Large Language Models" (2022, arXiv에 공개된 프리프린트 판) — arXiv:2206.07682 — 작은 모델에 없고 큰 모델에 있는 능력을 창발로 정의. 작은 모델 외삽으로 예측 불가, 더 키우면 능력 범위가 넓어질 수 있음.
  • "Are Emergent Abilities of Large Language Models a Mirage?" (2023, arXiv에 공개된 프리프린트 판) — arXiv:2304.15004 — 창발은 잣대 선택 때문에 나타날 수 있다. 비선형·불연속 잣대는 창발처럼, 연속 잣대는 매끄러운 변화. 창발은 근본 성질이 아닐 수도 있다.
  • "Visual interpretability for deep learning: a survey" (2018) — DOI: 10.1631/fitee.1700808 — 깊은 신경망은 높은 판별력을 블랙박스 표현의 낮은 해석 가능성과 맞바꾼다.
  • "A Survey on Neural Network Interpretability" (2021) — DOI: 10.1109/tetci.2021.3100641 — 블랙박스 성질이 신뢰와 알고리즘 차별 같은 윤리 문제에 영향. 해석 가능성의 정의와 분류.
  • "Grad-CAM: Visual Explanations from Deep Networks via Gradient-Based Localization" (2017) — DOI: 10.1109/iccv.2017.74 — 예측에 중요한 이미지 영역을 보여 주는 지도. 오답의 이유·데이터 편향 발견, 비전문가가 더 나은 신경망을 가려냄.
  • "Explaining Explanations: An Overview of Interpretability of Machine Learning" (2018) — DOI: 10.1109/dsaa.2018.00018 — 설명은 표준화·체계적 평가가 되어 있지 않고, 깊은 신경망에 대한 현재 접근은 불충분.
  • "Interpretable machine learning: Fundamental principles and 10 grand challenges" (2022) — DOI: 10.1214/21-ss133 — 해석 가능한 머신러닝의 열 가지 과제에 신경망 표현의 지도·비지도 분리가 들어 있다.
📚 AI 첫걸음 — 예시에서 배우고, 이어 붙이고, 틀리는 계산
2 / 4
  1. 1.AI 모델 — 규칙 대신 예시에서 배우는 계산
  2. 2.신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것
  3. 3.생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장
  4. 4.AI의 오류 — 시험장 밖에서 틀리는 수험생
← 이전 글AI 모델 — 규칙 대신 예시에서 배우는 계산다음 글 →생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.