Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

AI 모델 — 규칙 대신 예시에서 배우는 계산

스팸 필터 하나로 따라가는 첫걸음. 모델·학습·추론, 배우는 방식 세 가지, 그리고 외운 것과 배운 것을 가르는 시험 데이터

🌱첫걸음✦AI 생성컴퓨터과학·AI · 2026년 10월 3일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

AI 모델 — 규칙 대신 예시에서 배우는 계산

스팸 메일을 걸러 내는 두 가지 방법

메일함으로 쏟아지는 광고 메일, 스팸을 걸러 내는 프로그램을 만든다고 해 보겠습니다. 첫 번째 방법은 사람이 규칙을 적는 것입니다. 제목에 「당첨」이 들어 있으면 스팸, 모르는 주소가 보낸 메일에 링크가 셋 넘게 있으면 스팸, 하는 식입니다. 규칙은 분명하고, 어떤 메일이 왜 걸렸는지도 바로 보입니다.

곤란한 점은 스팸을 보내는 쪽도 규칙을 알아챈다는 것입니다. 「당첨」을 「당.첨」으로 바꾸면 규칙이 놓칩니다. 규칙을 하나 더 적으면 또 다른 틈이 생기고, 멀쩡한 메일이 규칙에 걸리기도 합니다. 규칙은 계속 늘어나고, 그 목록을 사람이 다 돌보기가 점점 어려워집니다.

두 번째 방법은 규칙을 적지 않습니다. 사람이 「이건 스팸」「이건 아님」이라고 표시해 둔 메일 수만 통을 컴퓨터에 보여 주고, 둘을 가르는 방식을 컴퓨터가 스스로 찾게 합니다. 새 메일이 오면 그렇게 찾은 방식으로 판정합니다. 이 글은 이 두 번째 방법을 따라갑니다.

규칙을 적는 대신 예시를 보여 준다

스팸 필터의 두 번째 방법에는 이름이 있습니다. 머신러닝은 사람이 규칙을 하나하나 적어 넣는 대신, 컴퓨터가 예시 데이터나 경험에서 입력을 처리하는 방식을 스스로 찾아내게 하는 방법입니다. 컴퓨터는 그렇게 찾은 방식으로 처음 보는 데이터의 결과를 내다봅니다 (PMID 30906397).

머신러닝은 인공지능이라는 더 큰 이름 안에 있습니다. 인공지능은 사람이 지능을 써서 하던 일을 컴퓨터가 해내게 하려는 기술을 두루 부르는 말입니다. 한 분야라기보다 여러 갈래를 함께 덮는 우산 같은 이름입니다 (PMID 32387803). 머신러닝은 그 우산의 한가운데에 있습니다. 경험을 통해 저절로 나아지는 컴퓨터를 어떻게 만들지를 묻는 분야이고, 컴퓨터과학과 통계학이 만나는 자리에 있습니다 (DOI: 10.1126/science.aaa8415).

글을 다루는 프로그램이 규칙에서 예시로 옮겨 온 길을 그대로 밟았습니다. 처음에는 사람이 문법 규칙과 사전을 직접 짜 넣었는데, 손이 많이 들고 융통성이 없었습니다. 20세기 후반부터는 많은 글에서 언어의 패턴을 스스로 익히는 방식으로 넘어갔습니다 (PMID 40892454). 어느 쪽이 나은지는 문제에 달려 있습니다. 규칙이 짧고 분명하게 적히는 문제라면 규칙이 낫습니다. 고양이 사진을 고양이로 알아보는 규칙처럼 말로 적기 어려운 문제에서, 데이터가 넉넉하면 예시에서 배우는 쪽이 힘을 씁니다. 사람이 규칙이나 풀이 방법을 세우기 어려운 문제에서 머신러닝이 쓸모를 찾습니다 (DOI: 10.1109/tccn.2018.2881442).

요즘 많이 쓰는 생성형 AI도 이 큰 분야 안의 한 갈래로 다뤄집니다 (PMID 39755237). 생성형 AI가 문장을 어떻게 이어 만드는지는 이 시리즈의 다른 편 「생성형 AI의 대답」이 다룹니다.

규칙 프로그램은 사람이 답을 내는 방식을 적어 주고, 머신러닝은 예시를 보여 주고 그 방식을 컴퓨터가 찾게 합니다.

두 칸. 왼쪽은 사람이 바닥까지 흘러내린 긴 두루마리에 스팸 거르는 규칙을 적고 있고, 오른쪽은 스팸과 스팸 아님 표시가 붙은 편지 더미를 기계에 넣고 있다.

모델 — 숫자를 맞춰 쓰는 계산 장치

스팸 필터가 메일 한 통을 받아서 하는 일은 결국 계산입니다. 메일에서 뽑은 여러 값이 들어가고, 「스팸일 가능성」 같은 값 하나가 나옵니다. 이 계산을 하는 것이 모델입니다. 모델은 입력을 받아 출력을 내는 계산 장치로, 그 안의 숫자들을 조정해 원하는 답에 가깝게 만들 수 있습니다.

학습하기 전의 모델은 안의 숫자가 아직 예시에 맞춰지지 않아서 엉뚱한 답을 냅니다. 신경망처럼 흔히 쓰는 모델은 이 숫자를 무작위로 흩어 놓은 채 출발합니다. 그 숫자를 예시에 맞게 고쳐 가는 일이 학습입니다. 학습은 예시 데이터나 경험에 맞춰 모델 안의 숫자들을 조금씩 고쳐 가는 과정으로, 훈련이라고도 부릅니다. 이때 보여 주는 예시 묶음에도 이름이 있습니다. 훈련 데이터는 학습하는 동안 모델에 보여 주며 숫자를 맞추는 데 쓰는 예시들입니다.

모델 안의 그 숫자들을 부르는 이름이 파라미터입니다. 파라미터는 모델 안에서 학습으로 정해지는 숫자들로, 모델이 입력을 어떻게 계산해 답을 내는지가 이 숫자들로 정해집니다. 개수는 적지 않습니다. 2010년 ImageNet 대회의 사진 120만 장을 1000가지로 가르도록 만든 한 모델에는 이런 숫자가 6천만 개 들어 있었습니다 (DOI: 10.1145/3065386). 이 숫자들이 안에서 어떻게 엮이고 어떻게 조금씩 옮겨지는지는 이 시리즈의 다른 편 「신경망과 파라미터」에서 이어 갑니다.

학습이 끝난 모델을 실제로 쓰는 단계는 따로 부릅니다. 추론은 학습을 마친 모델에 새 입력을 넣어 답을 받아 내는 일로, 모델을 실제로 쓰는 단계입니다. 따져서 결론을 끌어낸다는 일상어의 추론과는 쓰임이 다릅니다. 처음 보는 데이터의 결과를 내다보는 일이 바로 여기서 일어납니다 (PMID 30906397).

스팸 필터로 치면 학습은 표시된 메일 수만 통을 보는 준비 기간이고, 추론은 오늘 아침 도착한 메일 한 통을 판정하는 순간입니다. 학습은 쓰기 전에 몰아서 치르고 필요하면 다시 치르며, 추론은 쓸 때마다 일어납니다. 널리 쓰이는 방식에서는 추론하는 동안 모델 안의 숫자가 바뀌지 않습니다. 필터가 새 메일을 판정한다고 저절로 더 배우지는 않고, 더 배우게 하려면 학습을 다시 돌립니다. 숫자가 그대로인데도 같은 질문에 답이 달라지는 모델이 있는데, 그 까닭은 이 시리즈의 다른 편 「생성형 AI의 대답」에서 다룹니다.

모델은 숫자를 조정할 수 있는 계산이고, 학습은 그 숫자를 예시에 맞추는 준비, 추론은 다 맞춘 모델을 쓰는 일입니다.

배우는 방식 세 가지 — 정답이 붙었나, 없나, 점수만 오나

공부에 빗대면 차이가 잘 보입니다. 해설지가 딸린 문제집으로 공부할 수도 있고, 정답 없는 문제 더미를 유형별로 나눠 볼 수도 있고, 직접 해 보고 점수만 받으며 연습할 수도 있습니다. 머신러닝의 주요 갈래도 이 셋에 맞춰 나뉩니다 (PMID 41429301).

해설지의 정답에 해당하는 것이 라벨입니다. 라벨은 예시마다 붙여 둔 정답 표시로, 「이 메일은 스팸」「이 사진은 고양이」 같은 것입니다. 지도학습은 라벨이 붙은 예시로 학습해, 새 입력을 보고 그 라벨을 맞히게 하는 방식입니다. 스팸 필터와 사진 분류가 모두 여기에 속합니다. 라벨은 대개 사람이 붙이므로, 라벨을 모으는 품이 지도학습의 큰 비용입니다.

라벨이 없을 때도 배울 것은 있습니다. 비지도학습은 라벨 없이 예시만 주고, 그 안에서 비슷한 것끼리의 묶음이나 숨은 구조를 찾게 하는 방식입니다. 쇼핑몰 손님을 사는 물건이 비슷한 사람끼리 무리로 나누는 일이 그런 예입니다. 머신러닝이 잘 되느냐는 데이터를 어떤 모양으로 나타내느냐에 크게 좌우되고, 라벨 없이 데이터에서 쓸모 있는 표현을 스스로 찾는 방법이 이 갈래에서 연구돼 왔습니다 (DOI: 10.1109/tpami.2013.50).

스팸 메일에 비지도학습을 쓰면 무엇이 나올지 따라가 보면 차이가 선명해집니다. 라벨 없는 메일 수만 통을 넣으면, 모델은 내용이 비슷한 메일끼리 몇 무리로 묶어 냅니다. 광고 무리, 업무 연락 무리, 뉴스레터 무리가 생길 수 있습니다. 그러나 어느 무리가 스팸인지는 모델이 알려 주지 않습니다. 무리에 이름을 붙이는 일은 사람이 무리를 들여다보고 해야 합니다.

세 번째는 정답 대신 점수를 줍니다. 강화학습은 정답을 알려 주는 대신, 해 본 행동에 점수를 주고 점수가 커지는 쪽으로 행동을 고쳐 가게 하는 방식입니다. 아타리 비디오 게임, 바둑, 체스 같은 복잡한 게임에서 큰 성공을 거뒀습니다 (PMID 30815460). 한 번의 판정보다 차례로 이어지는 결정들의 전략을 다듬는 데 쓰입니다 (PMID 39592855). 학습 정의가 말한 「경험」이 바로 이 해 보기입니다.

정답이 붙은 예시로 배우면 지도학습, 정답 없이 구조를 찾으면 비지도학습, 해 본 결과에 점수만 받으면 강화학습입니다.

세 칸. 첫 칸은 고양이·개 사진마다 정답 꼬리표가 붙은 지도학습, 둘째 칸은 꼬리표 없는 사진들이 고양이·개·새 묶음으로 모인 비지도학습, 셋째 칸은 미로 속 장난감 로봇이 해 본 걸음마다 더하기·빼기 점수를 받는 강화학습이다.

셋 밖의 갈래도 있습니다. 사람이 라벨을 붙이지 않고 데이터 자체에서 정답을 만들어 배우는 방식으로, 글의 한 부분을 가려 두고 그 부분을 맞히게 하는 식입니다. 챗봇이 처음 배우는 과정이 이 방식이고, 이 시리즈의 다른 편 「생성형 AI의 대답」이 이어 받습니다.

외운 것과 배운 것

기출문제집 한 권을 통째로 외운 수험생이 있습니다. 그 문제집에서는 만점입니다. 그런데 숫자만 바뀐 새 문제를 받으면 막힙니다. 옆자리 수험생은 같은 문제집으로 푸는 방법을 익혔고, 새 문제도 풉니다. 두 사람의 문제집 점수는 같습니다.

모델에게도 같은 일이 생깁니다. 과적합은 모델이 훈련 데이터에 지나치게 맞춰져, 그 데이터의 우연한 특징까지 외운 탓에 처음 보는 데이터에서는 잘 맞히지 못하는 상태입니다. 스팸 필터라면, 훈련 데이터 속 스팸 몇 통에 우연히 있던 표현을 붙잡아 훈련 데이터에서는 다 맞히고 새 스팸은 놓치는 식입니다. 일반화는 학습 때 보지 못한 새 데이터에서도 잘 맞히는 능력입니다.

과적합과 일반화는 머신러닝의 기본 개념에 속합니다 (DOI: 10.1016/j.physrep.2019.03.001). 반대쪽 실패도 있습니다. 너무 덜 맞춰서 기본 패턴조차 못 잡는 상태입니다. 지나치게 맞추는 쪽과 덜 맞추는 쪽을 둘 다 피하는 일이 일반화 성능을 높이는 데 결정적입니다 (DOI: 10.1007/978-3-031-39355-6_10).

스팸 필터로 두 실패를 나란히 놓으면 이렇습니다. 덜 맞춘 필터는 「제목에 느낌표가 있으면 스팸」 같은 단서 하나만 붙잡아서, 훈련 데이터에서도 새 메일에서도 자주 틀립니다. 지나치게 맞춘 필터는 훈련 데이터에서는 거의 틀리지 않다가 새 메일에서 틀립니다. 덜 맞춘 필터는 훈련 데이터의 점수만 봐도 드러나지만, 지나치게 맞춘 필터는 처음 보는 메일에서 재야 드러납니다.

과적합한 모델을 훈련 데이터의 점수로만 재면, 실력을 실제보다 높게 믿게 됩니다. 이렇게 모델을 과신하거나 모델이 기대에 못 미치는 일은 특히 따질 항목이 많은 데이터, 적은 예시, 강력한 학습 방법, 불완전한 데이터 설계에서 잘 생깁니다 (DOI: 10.1007/978-3-031-39355-6_10). 사진 120만 장으로 학습한 앞의 사진 분류 모델도 과적합을 줄이는 장치를 따로 넣었습니다 (DOI: 10.1145/3065386).

강화학습도 비켜 가지 못합니다. 학습하는 동안 똑같이 최고 점수를 받은 강화학습 프로그램들이, 학습 때 보지 못한 상황에서는 성적이 크게 갈렸다는 실험이 있습니다. 이 결과는 동료심사를 거치지 않은 프리프린트입니다 (DOI: 10.48550/arxiv.1804.06893). 학습 중 점수가 같다는 것만으로는 무엇을 배웠는지 알 수 없다는 뜻입니다.

수험생 비유에는 한계가 있습니다. 수험생이 「푸는 방법을 익혔다」고 하면 이해했다는 뜻이 따라오지만, 모델의 일반화는 처음 보는 데이터에서 점수가 나온다는 관찰입니다. 그 점수 뒤에서 모델이 무언가를 이해하는지는 이 글이 판정하지 않습니다. 그 물음은 아직 논쟁 중이고, 「AI는 정말 '생각'하는가」가 다룹니다.

훈련 데이터에서 잘 맞히는 것만으로는 배웠는지 알 수 없고, 처음 보는 데이터에서 맞혀야 일반화가 확인됩니다.

그래서 시험 문제는 따로 둔다

수험생이 외웠는지 익혔는지 가려내는 가장 쉬운 방법은 한 번도 본 적 없는 문제를 내는 것입니다. 머신러닝도 그렇게 합니다. 예시를 모으면 학습을 시작하기 전에 일부를 떼어 둡니다. 시험 데이터는 학습에 전혀 쓰지 않고 따로 떼어 두었다가, 다 배운 모델의 실력을 잴 때만 쓰는 예시들입니다. 학습 도중에 여러 모델을 견주거나 손볼 때는 훈련 데이터에서 다시 떼어 낸 몫으로 재고, 시험 데이터는 맨 끝에 한 번만 씁니다. 앞의 사진 분류 모델도 성적을 시험 데이터에서 잰 오류율로 보고했습니다 (DOI: 10.1145/3065386).

책상 위에 편지 더미가 크게 쌓여 기계로 들어가고(훈련 데이터), 그 옆에 작은 편지 묶음이 밀랍으로 봉한 봉투에 따로 들어 있다(시험 데이터 — 끝날 때까지 봉해 둠).

시험지는 한 번이라도 공부에 쓰이면 시험지 구실을 못 합니다. 모델을 만드는 과정 어디에서든 시험 데이터의 정보가 새어 들어가면, 점수는 실제보다 좋게 나오기 쉽습니다. 메일의 어떤 특징을 볼지 고르는 준비 단계에서 시험 데이터의 정답(라벨)까지 보고 고르는 것이 그런 길의 하나입니다. 같은 실험에서 라벨을 보지 않고 고르는 방식은 점수를 크게 부풀리지 않았습니다 (DOI: 10.1093/bioinformatics/btp621).

한 실험이 그 크기를 보여 줍니다. 정답을 무작위로 붙여서 애초에 맞힐 규칙이 없는 데이터로도 이렇게 새는 절차를 밟자 점수가 크게 부풀었습니다. 0.5가 찍기, 1.0이 완벽인 점수에서, 가장 작은 데이터에 가장 공격적인 고르기 방식을 쓴 경우 약 0.5가 올라, 찍기 수준이던 점수가 만점 가까이 갔습니다. 예시가 1,000개인 데이터에서도 작지만 통계적으로 의미 있게 0.04가 올랐습니다 (DOI: 10.1093/bioinformatics/btp621). 단백질 자료로 한 단일 연구입니다.

현장에서 전해지던 머신러닝의 요령을 따로 모아 둔 글이 있습니다 (DOI: 10.1145/2347736.2347755). 시험 데이터를 끝까지 봉해 두는 일도 그런 요령에 넣을 만합니다. 널리 쓰는 시험 문제가 학습 자료에 섞여 드는 일은 요즘 큰 모델에서 따로 문제가 되고, 이 시리즈의 다른 편 「AI의 오류」가 이어 받습니다.

시험 데이터는 학습이 끝날 때까지 봉해 둬야 하고, 새어 들어가면 점수가 실력보다 좋게 나오기 쉽습니다.

데이터가 모델을 크게 좌우한다

한국어 메일로만 학습한 스팸 필터가 영어 스팸을 받으면 어떻게 판정할지는 아무도 장담하지 못합니다. 모델이 배울 재료는 보여 준 예시뿐이기 때문입니다.

머신러닝이 최근 크게 자란 데에는 새 학습 방법과 이론의 발전에 더해, 온라인 데이터가 폭발적으로 늘고 계산이 싸진 것이 함께 작용했습니다 (DOI: 10.1126/science.aaa8415). 데이터는 양과 함께 질도 따집니다. 현장에 머신러닝을 들이는 일을 다룬 입문 종설에서도 데이터의 질이 중요한 조건으로 꼽힙니다 (PMID 41429301).

학습 때와 쓸 때의 데이터가 달라지는 일도 있습니다. 앞에서 떼어 둔 시험 데이터는 훈련 데이터와 같은 모음에서 나왔지만, 실제로 쓰는 자리의 데이터는 그 모음과 다를 수 있습니다. 머신러닝은 학습 때와 쓸 때 사이의 이런 변화를 잘 다루지 못하는 일이 많고, 그런 변화는 실제 상황에서 흔하며 흔히 쓰는 방법의 성능을 크게 떨어뜨립니다. 이 차이를 줄이는 방법도 함께 연구되고 있습니다 (DOI: 10.1609/aaai.v30i1.10306). 실제로 쓰이는 AI 응용에서는 여러 방식의 편향이 드러났고, 편향이 들어오는 경로도 여럿입니다 (DOI: 10.1145/3457607). 이 둘은 이 시리즈의 다른 편 「AI의 오류」의 주제입니다.

모델은 보여 준 데이터에서 배우므로, 데이터에 없던 상황에서의 답은 보장되지 않습니다.

스팸 필터 한 대가 만들어져 쓰이기까지

이제 배운 것을 한 번에 따라가 보겠습니다. 먼저 사람이 메일 수만 통에 「스팸」「아님」 라벨을 붙입니다. 정답이 붙은 예시로 배우니 지도학습입니다. 라벨을 다 붙이면 학습을 시작하기 전에 일부를 떼어 봉해 둡니다. 그것이 시험 데이터이고, 나머지가 훈련 데이터입니다.

다음은 학습입니다. 모델은 훈련 데이터의 메일을 보며 안의 숫자를 조금씩 고칩니다. 훈련 데이터에서의 점수는 금세 오릅니다. 그러나 그 점수는 외운 결과일 수도 있습니다. 훈련 데이터 속 몇 통에만 있던 표현을 붙잡았다면, 그것은 과적합입니다.

그래서 봉인을 뜯어 시험 데이터로 잽니다. 여기서 점수가 나와야 일반화가 확인됩니다. 이 점수를 믿으려면 조건이 하나 붙습니다. 모델을 견주고 손보는 일은 훈련 데이터에서 떼어 낸 몫으로 했어야 하고, 어떤 특징을 볼지 고르는 단계까지 포함해 어느 단계에서도 시험 데이터를 들여다보지 않았어야 합니다.

이제 필터는 매일 아침 새 메일을 판정합니다. 이것이 추론입니다. 널리 쓰이는 방식이라면 판정하는 동안 필터 안의 숫자는 그대로입니다. 그러다 스팸을 보내는 쪽이 새 수법을 쓰기 시작합니다. 시험 점수는 학습 때와 비슷한 메일에서 잰 점수였기에, 달라진 메일 앞에서는 성능이 떨어질 수 있습니다. 그러면 새 예시에 라벨을 붙이고, 시험용 몫도 새로 떼어 봉한 뒤 학습과 채점을 다시 합니다. 이 일이 되풀이됩니다.

첫 절의 규칙 목록은 이 과정에서 사라졌습니다. 대신 어떤 예시를 보여 줄지 고르고, 무엇을 봉해 둘지 정하고, 점수가 어디서 나왔는지 따지는 일이 사람에게 남았습니다.

어디를 더 볼까

모델 안의 숫자가 어떻게 엮이고 학습 때 어느 쪽으로 옮겨지는지는 이 시리즈의 다른 편 「신경망과 파라미터」가, 챗봇이 문장을 한 조각씩 이어 만드는 방식은 「생성형 AI의 대답」이 다룹니다. 편향, 학습 때와 달라진 상황, 시험 문제가 학습 자료에 섞여 드는 일은 「AI의 오류」로 이어집니다.

일반화가 곧 이해인지의 논쟁은 「AI는 정말 '생각'하는가」에서, 시험 점수가 실제 능력을 얼마나 말해 주는지는 「점수는 올랐다. 그런데 무엇이 올랐나」에서 더 깊이 볼 수 있습니다. 규칙에서 예시로 넘어온 이 분야의 역사는 「역전파에서 알파폴드까지 — 딥러닝은 무엇을 딛고 올라섰나」가 따라갑니다.

근거 논문

  • "Artificial Neural Network: Understanding the Basic Concepts without Mathematics." (2018) — PMID 30906397 — 머신러닝은 기계가 입력 데이터를 어떻게 처리할지 스스로 정하고 새 데이터에서 결과를 예측하는 것이라고 정의하는 입문 종설.
  • "Understanding artificial intelligence based radiology studies: What is overfitting?" (2020) — PMID 32387803 — 인공지능은 인간 지능을 흉내 내는 과제를 수행하는 알고리즘을 만드는 여러 하위 분야를 덮는 넓은 우산 용어이며, 기본 개념 설명을 과적합에서 시작한다.
  • "Machine learning: Trends, perspectives, and prospects" (2015) — DOI: 10.1126/science.aaa8415 — 머신러닝은 경험으로 저절로 나아지는 컴퓨터를 만드는 물음을 다루고, 컴퓨터과학과 통계학의 교차점이자 AI의 핵심이며, 최근 진전은 새 알고리즘·이론과 온라인 데이터 폭증·값싼 계산이 이끌었다.
  • "Texts Are More than Notes, They Are Data: A Glimpse into How Machines Understand Text." (2025) — PMID 40892454 — 자연어 처리는 손으로 짠 문법 규칙·사전(노동 집약적, 유연성 부족)에서 20세기 후반 통계적 방법으로, 이어 머신러닝 모델로 옮겨 갔다.
  • "A Very Brief Introduction to Machine Learning With Applications to Communication Systems" (2018) — DOI: 10.1109/tccn.2018.2881442 — 데이터·계산 자원이 풍부해지면서, 모형화나 알고리즘의 한계로 기존 공학적 해법을 세우기 어려운 문제에 데이터 기반 머신러닝을 적용하려는 관심이 커졌다는 튜토리얼(지도·비지도 학습 기초).
  • "Introduction to Artificial Intelligence and Machine Learning in Pathology and Medicine: Generative and Nongenerative Artificial Intelligence Basics." (2025) — PMID 39755237 — AI-ML 분야를 생성형과 비생성형(전통) AI로 나눠 개관하는 입문 종설.
  • "ImageNet classification with deep convolutional neural networks" (2017) — DOI: 10.1145/3065386 — ImageNet LSVRC-2010의 120만 장을 1000개 범주로 분류한 6천만 파라미터 신경망, 시험 데이터 오류율로 이전 최고 기록을 크게 넘었고 과적합을 줄이려 드롭아웃을 썼다.
  • "Machine learning and deep learning in internal medicine: demystifying concepts." (2026) — PMID 41429301 — 학습의 주요 유형(지도·비지도·강화학습)과 데이터 질의 중요성을 입문자용으로 설명한다.
  • "Representation Learning: A Review and New Perspectives" (2013) — DOI: 10.1109/tpami.2013.50 — 머신러닝 알고리즘의 성공은 대체로 데이터 표현에 달려 있으며, 비지도 특징 학습과 딥러닝의 진전을 개관한다.
  • "Deep Reinforcement Learning in Medicine." (2019) — PMID 30815460 — 강화학습은 아타리·바둑·체스 같은 복잡한 게임에서 큰 성공을 거뒀고, 이는 심층 신경망과의 결합 덕이 크다.
  • "A Primer on Reinforcement Learning in Medicine for Clinicians." (2024) — PMID 39592855 — 강화학습은 불확실성 아래에서 순차적 전략을 최적화하는 머신러닝 패러다임이다.
  • "A high-bias, low-variance introduction to Machine Learning for physicists" (2019) — DOI: 10.1016/j.physrep.2019.03.001 — 편향-분산 절충(통계 용어로, 공정성의 편향과 다르다)·과적합·정칙화·일반화·경사하강을 머신러닝의 기본 개념으로 먼저 다루는 입문 종설.
  • "Overfitting, Underfitting and General Model Overconfidence and Under-Performance Pitfalls and Best Practices in Machine Learning and AI" (2024) — DOI: 10.1007/978-3-031-39355-6_10 — 과적합·과소적합 회피가 높은 일반화 성능에 결정적이며, 모델 과신·저성능은 고차원 데이터·작은 표본·강력한 학습기·불완전한 데이터 설계에서 특히 잘 생긴다.
  • "A Study on Overfitting in Deep Reinforcement Learning" (2018, 프리프린트) — DOI: 10.48550/arxiv.1804.06893 — 강화학습 에이전트는 여러 방식으로 과적합할 수 있고, 학습 중 모두 최적 보상을 얻어도 시험 성능은 크게 다를 수 있어 더 신중한 평가 절차가 필요하다.
  • "Pitfalls of supervised feature selection" (2009) — DOI: 10.1093/bioinformatics/btp621 — 시험 데이터를 지도 특징 선택에 쓰면 분류기 성능이 과대 추정되며, 무작위 라벨 데이터의 가장 작은 표본에 가장 공격적인 선택 방식(Wrapper)을 쓴 경우 AUROC가 약 0.5 올랐고(라벨을 쓰지 않는 PCA는 부풀림 없음), 1,000개 표본에서도 0.04 올랐다.
  • "A few useful things to know about machine learning" (2012) — DOI: 10.1145/2347736.2347755 — 머신러닝 응용을 발전시키는 데 필요한 '민간 지식'을 정리한다.
  • "Return of Frustratingly Easy Domain Adaptation" (2016) — DOI: 10.1609/aaai.v30i1.10306 — 사람의 학습과 달리 흔히 쓰는 머신러닝은 학습(원천)·적용(목표) 입력 분포의 변화를 잘 다루지 못하며, 이런 영역 이동은 흔하고 성능을 심하게 떨어뜨린다. 저자들은 간단한 통계 정렬로 이를 줄이는 방법을 제안한다.
  • "A Survey on Bias and Fairness in Machine Learning" (2021) — DOI: 10.1145/3457607 — 여러 실제 AI 응용에서 드러난 편향과 편향의 여러 원천, 공정성 정의의 분류를 정리한 서베이.
📚 AI 첫걸음 — 예시에서 배우고, 이어 붙이고, 틀리는 계산
1 / 4
  1. 1.AI 모델 — 규칙 대신 예시에서 배우는 계산
  2. 2.신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것
  3. 3.생성형 AI의 대답 — 한 조각씩 골라 이어 붙인 문장
  4. 4.AI의 오류 — 시험장 밖에서 틀리는 수험생
다음 글 →신경망과 파라미터 — 수천억 개의 다이얼을 조금씩 돌린다는 것

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.