Paperis.

© 2026 네오쿤스. All rights reserved.

이용약관개인정보처리방침환불 정책콘텐츠·제거 요청

상호: 네오쿤스 · 대표자: 김근태 · 사업자등록번호: 751-04-03501 · 통신판매업 신고번호: 통신판매업 신고 후 표기 예정

주소: 서울특별시 서초구 서초대로 266, B103-S36호(서초동) · Tel: 010-7254-2475 · 이메일: support@paperis.app

Paperis.

Paperis 아티클

계산보다 나르기가 느리다 — 메모리 병목과 HBM

계산하는 칩과 데이터를 담아 두는 칩은 따로 있고, 여러 해 동안 계산은 빨라졌는데 데이터를 나르는 길은 그만큼 넓어지지 못했습니다. HBM은 메모리를 층층이 쌓아 프로세서 바로 옆에 붙이고 천 개가 넘는 선으로 한꺼번에 나르는 방법이고, 그 대가로 열·비용·용량의 청구서를 받습니다

🌱첫걸음✦AI 생성반도체·나노 · 2026년 9월 28일

내 분야 논문을 오디오로

관심 분야·저널을 고르면 Paperis가 핵심 논문을 요약하고 음성으로 변환해 드려요. 출퇴근길에 들어보세요.

Paperis 무료로 시작하기 →

계산보다 나르기가 느리다 — 메모리 병목과 HBM

요리사는 빠른데 재료가 늦다

「인공지능 칩 수요 급증, HBM 공급 부족」. 인공지능 뉴스를 따라가다 보면 이런 식의 제목을 자주 만납니다. 인공지능은 계산을 엄청나게 많이 하는 일인데, 뉴스는 계산하는 칩만큼이나 메모리 이야기를 많이 합니다. 메모리는 계산에 쓸 데이터를 담아 두었다가 필요할 때 내주는 칩입니다. 제목의 HBM은 계산하는 칩 바로 옆에 붙여 쓰는 메모리입니다. 어떻게 생겼는지는 식당 이야기를 끝낸 뒤에 보겠습니다. 이 글은 계산하는 일에 왜 메모리가 발목을 잡는지, 그리고 메모리를 왜 굳이 계산하는 칩 옆에 붙이는지를 다룹니다.

설명에는 식당 하나를 쓰겠습니다. 주방에 아주 솜씨 좋은 요리사가 한 명 있습니다. 이 요리사는 1분에 10접시를 만들 수 있습니다. 재료는 길 건너 창고에 있고, 창고와 주방 사이에는 좁은 복도가 하나 나 있습니다. 재료 한 상자로 한 접시를 만든다고 치고, 이 복도로는 1분에 2상자가 들어옵니다.

그러면 이 식당은 1분에 몇 접시를 낼까요? 요리사의 솜씨로는 10접시지만, 재료가 2상자뿐이니 2접시입니다. 요리사는 1분 가운데 대부분을 빈손으로 복도 쪽을 바라보며 보냅니다.

이 식당 예시와 그 숫자는 이해를 돕기 위해 만든 것입니다. 이 식당을 글 끝까지 들고 가겠습니다. 식당의 속도를 정하는 쪽은 요리사의 솜씨보다 재료가 들어오는 복도입니다. 컴퓨터 안에서도 똑같은 일이 일어나고, HBM은 그 복도를 넓히려는 방법입니다.

네 컷. 1분에 10접시를 만드는 요리사, 좁은 복도로 1분에 2상자를 나르는 사람, 2접시만 만들고 복도를 바라보며 기다리는 요리사, 창고와 좁은 복도와 주방을 한눈에 보여 주는 장면.

계산하는 칩과 담아 두는 칩

컴퓨터와 휴대폰 안에는 하는 일이 다른 칩이 따로 들어 있습니다. 식당의 요리사에 해당하는 칩부터 보겠습니다. 프로세서는 계산을 맡는 칩입니다. 컴퓨터의 중앙처리장치도, 인공지능 계산을 맡는 칩도 모두 프로세서입니다.

창고에 해당하는 칩이 앞에서 말한 메모리입니다. 메모리에는 여러 종류가 있는데, 계산하는 동안 쓰는 데이터를 담는 쪽은 주로 D램입니다. D램은 컴퓨터가 일하는 동안 데이터를 담아 두는 메모리로, 전원이 꺼지면 담긴 내용이 사라집니다. 사진이나 앱처럼 전원을 꺼도 남아야 하는 것은 다른 종류의 메모리에 저장합니다.

두 칩이 따로 있으니, 계산하려면 먼저 데이터를 메모리에서 프로세서로 옮겨야 합니다. D램에 담긴 데이터는 계산이 시작되기 전에 프로세서까지 건너가야 하고, 그 길은 칩과 바깥을 잇는 작은 연결 다리, 곧 핀의 수가 제한된 통로입니다. 이 옮기는 일에는 시간도 걸리고 에너지도 듭니다 (arXiv:1802.00320). 요리사가 아무리 빨라도 재료는 길을 건너와야 도마에 오릅니다.

계산하려면 먼저 날라 와야 하고, 나르는 길은 좁습니다. 이 한 줄이 이 글의 출발점입니다.

요리사만 빨라졌다

식당으로 돌아가 보겠습니다. 요리사를 더 솜씨 좋은 사람으로 바꿔서 1분에 20접시를 만들 수 있게 됐다고 합시다. 복도로 들어오는 재료가 그대로 1분에 2상자라면, 식당은 여전히 1분에 2접시를 냅니다. 요리사가 빨라진 만큼 기다리는 시간만 늘어납니다.

복도로 1분에 얼마나 들어오느냐에는 이름이 있습니다. 대역폭은 단위 시간에 실제로 옮길 수 있는 데이터의 양입니다. 식당으로 말하면 복도로 1분에 들어오는 상자 수이고, 컴퓨터에서는 「초당 몇 기가바이트」로 적습니다. 1기가바이트는 영어 알파벳 약 10억 개를 담을 수 있는 양입니다.

컴퓨터의 역사가 이 식당과 비슷하게 흘러왔습니다. 여러 해 동안 D램 기술은 더디게 발전했고, 그 결과 메모리가 컴퓨터 전체에서 점점 더 큰 병목이 됐습니다 (arXiv:1802.00320). 인공지능 계산에 쓰는 프로세서도 계산 능력은 계속 커지는데, 메모리 대역폭에 묶인 일에서는 그만큼 성능을 끌어올리지 못합니다 (arXiv:2602.18568). 계산 장치를 더 붙이는 것도 답이 되지 못합니다. 계산 장치가 늘면 그만큼 대역폭이 더 필요해져서, 문제를 오히려 키운 경우도 있습니다 (arXiv:2310.18181). 요리사를 한 명 더 뽑으면 복도에 들어와야 할 재료도 두 배가 되는 것과 같습니다.

이 상태에도 이름이 있습니다. 메모리 벽은 계산 장치는 계속 빨라지는데 메모리에서 데이터를 실어 오는 속도가 그만큼 따라오지 못해, 계산이 아니라 기다림이 성능을 정하게 된 상태를 가리킵니다. 우리 식당이 바로 그 상태입니다. 요리사를 바꿔도, 더 뽑아도 1분에 2접시입니다.

손 닿는 곳의 조리대

기다림을 줄이는 첫 번째 방법은 오래전부터 쓰여 왔습니다. 자주 쓰는 재료를 요리사 손 닿는 곳에 두는 것입니다. 소금이나 간장처럼 거의 모든 접시에 들어가는 재료를 조리대에 올려 두면, 그때마다 창고까지 가지 않아도 됩니다.

컴퓨터에서는 이 조리대를 캐시라고 부릅니다. 캐시는 프로세서 안이나 바로 곁에 두는, 작지만 빠른 저장 공간으로, 곧 다시 쓸 데이터를 가져다 둡니다. 조리대는 대개 여러 칸입니다. 손 바로 앞의 아주 작은 칸, 조금 떨어진 조금 큰 칸, 그 뒤의 더 큰 칸처럼, 가까울수록 작고 빠르게 층층이 둡니다.

여기서 앞에 깔아 둔 가정 하나를 풀어야 합니다. 식당 예시는 「재료 한 상자로 한 접시」라고 쳤습니다. 조리대가 힘을 쓰는 것은 한 번 가져온 재료로 여러 접시를 만들 수 있을 때입니다. 소금 한 통을 조리대에 올려 두면, 소금 몫으로는 복도를 한 번만 오가고 백 접시에 나눠 씁니다. 한 접시에 드는 재료 가운데 이렇게 여러 번 쓰이는 몫이 클수록 복도로 오가는 상자가 줄어듭니다. 반대로 접시마다 새 재료가 필요하고 조리대에 다 올릴 수도 없으면, 조리대가 있어도 요리사는 다시 복도를 바라봅니다.

실제 계산도 그렇습니다. 메모리에서 가져오는 데이터는 프로세서의 캐시 덕을 보지 못하고 그대로 길을 건너와야 하는 경우가 많습니다 (arXiv:1802.00320). 중력파 신호를 찾는 계산에서는 한 번에 다뤄야 하는 데이터가 캐시 용량을 넘자, 프로세서가 멈춰 서서 기다리는 일이 크게 늘었습니다 (arXiv:2601.18835). 데이터가 조리대에 들어가지 않으면 창고까지 오가는 길이 다시 속도를 정합니다.

나르는 데는 시간과 함께 전기도 듭니다. 데이터를 메모리에서 프로세서까지 옮기는 일에는 큰 에너지 부담이 따릅니다 (arXiv:1802.00320). 큰 인공지능 모델을 돌릴 때는 에너지에서 가장 큰 몫을 계산보다 데이터 이동이 차지한다는 것이, 2026년에 나온 한 종설의 정리입니다 (arXiv:2608.28048, 동료 심사 전 종설). 이런 식당에서는 요리사가 칼질에 쓰는 힘보다 재료를 나르는 데 쓰는 힘이 더 큽니다.

조리대는 여러 번 쓰는 재료에만 힘을 씁니다. 한 번 쓰고 마는 재료가 많을수록 복도의 폭이 다시 중요해집니다.

인공지능은 왜 나르기에 목마른가

이제 뉴스의 주인공, 대화형 인공지능으로 가 보겠습니다. 이런 인공지능은 질문을 받으면 답을 한꺼번에 내놓지 않고 낱말을 하나씩 이어 붙여 만듭니다. 이렇게 낱말을 만드는 동안 메모리에서 실어 오는 데이터에는 모델이 배운 내용을 담은 엄청난 양의 숫자가 들어갑니다 (arXiv:2502.10659).

문제는 가져온 양에 비해 하는 계산이 적다는 점입니다. 답을 낱말 하나씩 만들어 내는 단계는 가져온 데이터로 하는 계산이 적어서, 성능이 메모리 대역폭에 크게 좌우됩니다 (arXiv:2604.04253). 식당으로 말하면 소금을 조리대에 두고 백 접시에 쓰는 쪽보다 「한 상자로 한 접시」 쪽에 가깝습니다. 이런 큰 인공지능 모델을 빠르게 돌리는 데 결정적인 제약은 계산보다 메모리이고, 특히 낱말을 하나씩 만드는 단계가 대역폭에 묶인다는 것이 앞의 종설이 내린 결론입니다 (arXiv:2608.28048).

이 천장을 거의 그대로 보여 준 실험이 있습니다. 먼저 한 가지를 짚어 두면, 칩에 적히는 대역폭은 길이 허락하는 최대치이고 실제로 그만큼 다 쓰기는 어렵습니다. 작은 장치는 대개 대역폭이 초당 20기가바이트가 채 안 됩니다. 그런 장치 하나에 인공지능 모델을 올리고, 데이터가 오가는 길을 최대한 다듬었습니다. 결과는 초당 낱말 5개 안팎이었고, 이 속도는 그 장치의 메모리 대역폭이 허락하는 이론상 한계의 85%였습니다 (arXiv:2502.10659, 작은 장치 하나에서 잰 단일 실측). 복도가 허락하는 재료를 거의 다 받아서 쓰고 있었다는 뜻입니다. 이 장치에서 속도를 더 올릴 여지는 복도 쪽에 있습니다.

요리사를 더 빠르게 하면 어떨까요. 프로세서의 동작 속도를 높이는 모의실험에서, 질문을 한꺼번에 읽어 들이는 단계는 빨라졌지만 낱말을 하나씩 만드는 단계의 이득은 외부 메모리 대역폭에서 멈췄습니다 (arXiv:2512.22066, 모의실험). 저자들은 메모리 대역폭이 성능의 천장처럼 작동한다고 적었습니다. 우리 식당에서 요리사를 1분 20접시로 바꿔도 2접시가 나오던 것과 같은 모양입니다.

대화형 인공지능이 답을 만드는 속도는 계산하는 힘보다 메모리에서 데이터를 나르는 폭에 먼저 걸립니다. 인공지능 뉴스가 메모리를 자주 말하는 이유가 여기에 있습니다.

반대 방향도 있습니다. 복도가 충분히 넓어지면 이번에는 다시 요리사가 속도를 정합니다. 우리 식당에서 복도가 1분에 20상자를 들이면, 1분에 10접시를 만드는 요리사가 다시 한계입니다. 쌓은 메모리 바로 곁에서 계산하도록 대역폭을 크게 넓힌 설계에서는, 낱말을 만드는 연산 상당수가 다시 계산 쪽에 묶인다는 분석이 있습니다 (arXiv:2604.04253).

창고를 쌓아 주방 옆에 — HBM

복도를 넓히는 방법은 두 가지입니다. 상자를 나르는 사람을 더 빨리 뛰게 하거나, 문을 더 많이 내는 것입니다. 컴퓨터로 말하면, 선 하나로 보내는 속도를 높이거나 메모리와 프로세서를 잇는 선을 더 많이 까는 것입니다.

선을 많이 까는 쪽에는 벽이 있었습니다. 컴퓨터에 꽂는 보통의 메모리 모듈은 연결할 수 있는 핀의 수가 제한되고 신호가 흐트러지는 문제 때문에 초당 50기가바이트를 넘기기 어려웠습니다 (DOI: 10.1109/isscc.2018.8310257, 2018년 논문의 배경 서술). 대역폭을 늘리려고 여러 개의 그래픽용 메모리를 한꺼번에 쓰면 전력 소비가 커지고 회로 기판 위의 배선이 빽빽하게 엉킵니다 (DOI: 10.1109/isscc.2016.7418034). 길 건너 창고에 문을 수백 개 내도, 그 문들에서 주방까지 복도 수백 개를 길 위로 깔 수는 없습니다.

HBM은 이 문제를 창고를 옮겨서 풉니다. 이름부터 High Bandwidth Memory, 곧 고대역폭 메모리의 약자입니다. D램 여러 층을 위로 쌓고, 쌓은 덩어리를 계산하는 칩 바로 옆, 같은 부품 안에 붙입니다 (DOI: 10.23919/date51398.2021.9474024). 식당으로 말하면 길 건너 창고와 별도로, 여러 층짜리 창고 건물을 주방 벽 바로 옆에 새로 지은 것입니다.

쌓은 층들끼리는 수직으로 이어야 합니다. 실리콘 관통 전극은 칩을 위아래로 꿰뚫어 낸 수직 구멍에 구리 같은 전도성 금속을 채워 만든 배선입니다 (DOI: 10.1002/9781118760475.ch06). 영어 약자로는 TSV라고 부릅니다. 창고 건물의 층마다 바닥을 뚫어 승강 통로를 낸 것과 같아서, 위층의 재료가 건물 둘레를 돌지 않고 곧장 아래로 내려옵니다. HBM은 이 수직 통로로 D램 여러 층을 이어 한 덩어리에 담는 양을 늘립니다. 그 덩어리는 촘촘한 배선을 깐 얇은 받침판 위에 프로세서와 나란히 올라갑니다. 2020년 논문 기준으로 둘 사이를 잇는 선은 1,024개입니다 (DOI: 10.1109/isscc19947.2020.9063110).

선이 이렇게 많으면 선 하나하나는 느려도 됩니다. HBM은 보통의 D램보다 선 하나의 속도는 낮은데도 전체 대역폭은 훨씬 높습니다 (DOI: 10.1109/isscc19947.2020.9062977). 식당으로 말하면, 사람을 뛰게 하는 대신 주방 벽에 문을 천 개 넘게 내고 각 문으로 천천히 상자를 넘기는 방식입니다.

단면도. 얇은 받침판 위에 프로세서와 D램 여러 층을 쌓은 덩어리가 나란히 놓여 있고, 수직 전극이 층들을 꿰뚫으며, 받침판 안의 촘촘한 선이 둘을 잇는다.

그 결과가 숫자로 나옵니다. D램 16층을 쌓은 HBM 한 덩어리가 초당 1,280기가바이트를 나른다는 발표가 2024년에 나왔습니다 (DOI: 10.1109/isscc49657.2024.10454440). 앞의 초당 50기가바이트와는 시점도 대상도 달라서 배수로 읽을 수는 없습니다. 이 글에 나오는 HBM 칩의 숫자는 대부분 반도체 회로 학회인 국제고체회로학회에서 나왔고, 칩을 만든 쪽이 자기 칩을 스스로 재어 발표한 값입니다.

창고를 주방 바로 위에 올리면 더 가깝지 않을까요. 메모리를 프로세서 위에 곧장 쌓는 방식은 더 높은 성능을 내지만 더 뜨겁게 돌아가 수명이 짧아지고, 옆에 나란히 두는 방식은 대역폭이 낮은 대신 열로 인한 노화가 적어 훨씬 오래 갑니다 (DOI: 10.1109/irps.2016.7574618). 저자들은 위에 쌓는 방식도 전압과 속도를 낮춰 돌리면 둘 사이에서 균형을 찾을 수 있다고 봤습니다. 앞에서 본 HBM은 받침판 위에서 옆에 나란히 두는 쪽입니다 (DOI: 10.1109/isscc19947.2020.9063110).

HBM은 창고를 쌓아서 주방 바로 옆에 붙이고, 문을 천 개 넘게 내어 한꺼번에 넓게 나르는 방법입니다.

청구서 — 열, 비용, 용량

창고를 쌓아 옆에 붙이는 데에는 청구서가 세 장 따라옵니다.

첫 장은 열입니다. 여러 층을 좁은 자리에 포개면 열이 빠져나갈 길이 좁아집니다. 3차원으로 쌓은 구조는 열이 빠져나가기 어려운 성질을 가지고, 열 관리가 부족하면 부품의 신뢰성을 위협합니다 (DOI: 10.1115/1.4025531). HBM에서도 대역폭을 높일수록 전력 소비가 한곳에 몰려 뜨거운 지점이 생기고, 이를 다스릴 적극적인 열 대책이 필요해집니다. 이 논문은 칩의 온도 분포에 맞춰 메모리의 동작을 조절하는 회로를 내놓았습니다 (DOI: 10.1109/isscc.2016.7418034). 층층이 쌓은 창고의 가운데 층은 바람이 잘 통하지 않습니다.

둘째 장은 비용입니다. 쌓아 올린 구조에서는 층과 층을 잇는 수직 통로가 제대로 연결되지 않는 불량이 생기고, 전압이 층을 지날 때마다 조금씩 떨어지는 문제가 쌓입니다. 이 문제들이 HBM의 총비용을 끌어올립니다 (DOI: 10.1109/isscc19947.2020.9062977). HBM이 비싸고, 만드는 과정이 복잡해 보통 D램보다 수율이 낮다는 지적도 있습니다 (arXiv:2501.09605, 새 메모리를 제안하는 저자들의 입장).

셋째 장은 용량입니다. 부품 안에 쌓아 넣은 메모리는 대역폭이 크고 데이터를 꺼내는 데 드는 에너지는 적지만, 담을 수 있는 양이 제한됩니다 (DOI: 10.1145/3286475.3286484). 2018년 논문이 당시 최신으로 꼽은 HBM 탑재 그래픽 칩의 메모리는 4기가바이트뿐이었습니다 (DOI: 10.1109/tvlsi.2018.2791442). 그 뒤로 층수가 늘어 16층 한 덩어리가 48기가바이트를 담게 됐지만 (DOI: 10.1109/isscc49657.2024.10454440), 큰 언어모델은 크기가 빠르게 커져 계산 능력과 메모리 대역폭의 발전마저 앞질렀다는 분석이 있습니다 (arXiv:2507.02456). 주방 옆 창고는 넓게 열린 대신 길 건너 창고만큼 크게 지을 수 없습니다.

남은 질문은 이것입니다. 대역폭을 지키면서 용량을 함께 키울 수 있는가. 2018년의 연구는 D램을 더 높이 쌓는 길에 연구가 더 필요하다고 결론지으며 층을 붙이는 다른 방식을 열쇠로 꼽았고 (DOI: 10.1145/3286475.3286484), 2026년의 한 전망 논문은 플래시 메모리로 HBM에 준하는 대역폭과 10배 용량을 얻는 길을 연구 과제로 꼽습니다 (arXiv:2601.05047).

뉴스 제목을 하나 읽어 보면

이제 가상의 기사 제목 하나를 읽어 보겠습니다. 「12단 HBM 공급 확대, 인공지능 칩 옆자리 경쟁」.

첫 물음은 「12단」이 무엇이냐입니다. HBM을 부를 때 붙는 8H, 12H 같은 표기의 H는 높이, 곧 D램을 몇 층 쌓았느냐를 뜻합니다 (DOI: 10.1109/irps48228.2024.10529424). 12단은 창고가 12층이라는 뜻입니다. 층이 늘면 한 덩어리에 담는 양이 늘고, 층을 지날 때마다 쌓이는 전압 강하 같은 문제도 함께 늘어납니다.

둘째 물음은 「왜 인공지능 칩 옆자리인가」입니다. 대화형 인공지능이 낱말을 하나씩 만드는 동안 속도를 크게 좌우하는 것은 복도의 폭이고, 옆자리에 붙은 창고가 그 폭을 넓힙니다. 인공지능 서버와 슈퍼컴퓨터의 수요로 HBM 쓰임이 크게 늘면서, 부품 하나에 들어가는 HBM의 수도 두 개에서 네 개 정도이던 것이 여섯에서 여덟 개로 늘고 있습니다 (DOI: 10.1109/irps48228.2024.10529424, 2024년 논문). 주방 둘레에 창고 건물이 여러 채 붙는 모습입니다.

셋째 물음은 「무엇을 치르나」입니다. 제목은 이 물음에 답하지 않지만, 앞 절의 청구서가 답합니다. 쌓은 층 사이에 갇히는 열, 수직 통로의 불량과 전압 문제가 올리는 값, 그리고 한 덩어리에 담을 수 있는 양의 한계입니다.

HBM이라는 말을 들으면 세 가지를 떠올리면 됩니다. 몇 층을 쌓았나, 얼마나 넓게 나르나, 그 대가로 무엇을 치르나.

어디를 더 볼까

이 글은 식당 하나로 메모리 병목의 뜻과 HBM의 생김새만 다뤘습니다. HBM이 지난 10년 동안 세대마다 어떻게 넓어졌는지, 쌓는 순간 따라오는 열·전압·용량의 청구서를 실제 논문의 숫자로 따라가는 글은 「병목은 계산이 아니었다 — 메모리를 쌓아 프로세서 옆에 붙인 10년」입니다.

아예 나르지 않고 메모리 안에서 계산을 시키면 어떨까라는 질문은 「나르지 말고 그 자리에서 하자 — 메모리에 계산을 시켰더니 질문이 여섯 개 남았다」가 이어 갑니다. D램 자체가 더 작아지기 어려운 이유와 그 뒤를 노리는 새 메모리들은 「차세대 메모리 — D램의 벽과 '꿈의 메모리'를 향한 경쟁」이 다룹니다.

「반도체 첫걸음」의 다른 글들은 칩의 가장 작은 부품인 트랜지스터가 무엇인지(「트랜지스터는 스위치다 — 전기로 여닫는 아주 작은 수도꼭지」), 뉴스의 「3나노」가 무엇의 길이인지(「「3나노」는 무엇의 길이인가 — 34평형 집을 줄자로 재면」), 칩의 회로를 빛으로 그리는 방법(「노광 — 빛의 붓으로 회로를 그리는 법」)을 다룹니다.

근거 논문

  • "Enabling the Adoption of Processing-in-Memory: Challenges, Mechanisms, Future Research Directions" (2018) — arXiv:1802.00320 — 여러 해 더딘 D램 발전으로 메모리가 점점 큰 병목이 됐다. 데이터는 핀이 제한된 통로로 CPU까지 옮겨져야 계산이 시작되고, 지연·에너지 부담이 크며 캐시 덕을 못 보는 경우가 많다.
  • "RPU -- A Reasoning Processing Unit" (2026) — arXiv:2602.18568 — GPU는 계산량을 계속 늘리지만 메모리 대역폭에 묶인 일에서는 성능 확장이 어렵다. 용량을 깎아 에너지·비용을 얻는 HBM을 제안(모의실험).
  • "An Energy-Efficient Near-Data Processing Accelerator for DNNs that Optimizes Data Accesses" (2023) — arXiv:2310.18181 — 계산 장치와 온칩 버퍼를 늘린 가속기들이 메모리 벽을 풀지 못했고, 계산 장치가 늘면 대역폭 요구도 늘어 문제를 키우기도 했다.
  • "Beyond FINDCHIRP: Breaking the memory wall and optimal FFTs for Gravitational-Wave Matched-Filter Searches with Ratio-Filter Dechirping" (2026) — arXiv:2601.18835 — 중력파 정합 필터 탐색의 병목은 계산 처리량보다 메모리 대역폭이고, 데이터가 캐시 용량을 넘으면 프로세서가 크게 멈춘다.
  • "AI Hardware Accelerators for Large Language Models: Architectures and the Memory Wall" (2026) — arXiv:2608.28048 — 대형 언어모델 가속의 결정적 제약은 산술이 아니라 메모리다. 낱말 생성 단계는 대역폭에 묶이고, 데이터 이동이 에너지를 지배한다(종설, 동료 심사 전).
  • "Rethinking Compute Substrates for 3D-Stacked Near-Memory LLM Decoding: Microarchitecture-Scheduling Co-Design" (2026) — arXiv:2604.04253 — 언어모델의 낱말 생성은 연산 밀도가 낮아 성능이 메모리 대역폭에 매우 민감하다. 3D 적층 근접 처리로 대역폭을 크게 넓히면 낱말 생성 연산 상당수가 다시 계산에 묶인다(분석).
  • "Pushing up to the Limit of Memory Bandwidth and Capacity Utilization for Efficient LLM Decoding on Embedded FPGA" (2025) — arXiv:2502.10659 — 4GB·20GB/s 미만 장치에서 70억 매개변수 모델로 초당 약 5낱말, 이론 대역폭 한계의 85%를 실측했다.
  • "Prefill vs. Decode Bottlenecks: SRAM-Frequency Tradeoffs and the Memory-Bandwidth Ceiling" (2025) — arXiv:2512.22066 — 동작 주파수를 높이면 문맥 입력 단계는 빨라지지만 낱말 생성 단계의 이득은 외부 메모리 대역폭에 막힌다. 대역폭이 성능의 천장으로 작동한다(모의실험).
  • "A 1.2V 64Gb 341GB/S HBM2 stacked DRAM with spiral point-to-point TSV structure and improved bank group data control" (2018) — DOI: 10.1109/isscc.2018.8310257 — 통상적 DIMM형 메모리는 핀 수 제약과 신호 무결성 문제로 50GB/s를 넘기 어렵다. TSV와 넓은 입출력의 HBM이 해법이지만 전력·신뢰성 한계가 남는다.
  • "18.2 A 1.2V 20nm 307GB/s HBM DRAM with at-speed wafer-level I/O test scheme and adaptive refresh considering temperature distribution" (2016) — DOI: 10.1109/isscc.2016.7418034 — 여러 GDDR을 함께 쓰면 전력과 기판 배선 혼잡이 문제다. HBM은 TSV·인터포저로 넓은 입출력을 얻고, 대역폭 증가는 집중된 전력 소비로 생기는 열 점에 대한 적극적 열 대책을 요구하며, 온도 분포에 따라 리프레시를 조절하는 회로 기법(ART)을 제안한다.
  • "Understanding power consumption and reliability of high-bandwidth memory with voltage underscaling" (2021) — DOI: 10.23919/date51398.2021.9474024 — HBM은 여러 D램 층을 쌓아 계산 칩 옆 같은 패키지 안에 둔 구조이며, 쌓은 메모리 층이 패키지 전력 예산의 상당 부분을 쓴다.
  • "3D Stacking of RAM–Processor Chips Using TSV" (2014) — DOI: 10.1002/9781118760475.ch06 — TSV는 칩의 수직 구멍을 구리 같은 전도성 금속으로 채운 배선이다. 3차원 적층의 과제는 열 방출·기계적·열적 응력 등이다.
  • "22.1 A 1.1V 16GB 640GB/s HBM2E DRAM with a Data-Bus Window-Extension Technique and a Synergetic On-Die ECC Scheme" (2020) — DOI: 10.1109/isscc19947.2020.9063110 — HBM은 2.5D 실리콘 인터포저로 1024개 입출력을, TSV 적층으로 큰 용량을 얻는다.
  • "22.3 A 128Gb 8-High 512GB/s HBM2E DRAM with a Pseudo Quarter Bank Structure, Power Dispersion and an Instruction-Based At-Speed PMBIST" (2020) — DOI: 10.1109/isscc19947.2020.9062977 — HBM은 통상 D램보다 낮은 핀 속도로 훨씬 높은 대역폭을 낸다. 3차원 적층이 TSV 연결 실패와 전압 강하 누적을 낳아 총비용을 올리고, 대역폭이 늘수록 전력·열 문제도 커진다.
  • "13.4 A 48GB 16-High 1280GB/s HBM3E DRAM with All-Around Power TSV and a 6-Phase RDQS Scheme for TSV Area Optimization" (2024) — DOI: 10.1109/isscc49657.2024.10454440 — 16층 적층 48GB, 1280GB/s HBM3E(제조사 발표).
  • "Reliability-performance tradeoffs between 2.5D and 3D-stacked DRAM processors" (2016) — DOI: 10.1109/irps.2016.7574618 — 계산 칩 위에 D램을 쌓으면 성능은 높지만 더 뜨거워 수명이 짧고, 인터포저로 옆에 두면 대역폭은 낮지만 열 노화가 적어 수명이 훨씬 길다.
  • "Solving Thermal Issues in a Three-Dimensional-Stacked-Quad-Core Processor by Microprocessor Floor Planning, Microchannel Cooling, and Insertion of Through-Silicon-Vias" (2013) — DOI: 10.1115/1.4025531 — 3차원 적층은 짧은 배선으로 대역폭·에너지 이득을 주지만 열 저항이 높아, 열 관리가 부족하면 신뢰성을 위협한다.
  • "Managed-Retention Memory: A New Class of Memory for the AI Era" (2025) — arXiv:2501.09605 — HBM은 인공지능 작업에 최적이 아니며, 비싸고 제조 복잡성 때문에 D램보다 수율이 낮다(새 메모리 부류를 제안하는 입장 논문).
  • "Challenges of High-Capacity DRAM Stacks and Potential Directions" (2018) — DOI: 10.1145/3286475.3286484 — 패키지 안 3차원 적층 메모리는 대역폭이 크고 접근 에너지가 낮지만 용량이 제한된다. 대역폭을 함께 키우며 높은 스택으로 용량을 늘리려면 더 많은 연구가 필요하고, 다른 접합·적층 기술이 열쇠일 수 있다.
  • "Performance Evaluation and Optimization of HBM-Enabled GPU for Data-Intensive Applications" (2018) — DOI: 10.1109/tvlsi.2018.2791442 — 당시 최신 HBM 탑재 GPU의 패키지 내 메모리 용량은 4GB로 제한적이었다.
  • "System-performance and cost modeling of Large Language Model training and inference" (2025) — arXiv:2507.02456 — 언어모델의 크기와 복잡성 증가가 계산 능력·메모리 대역폭·네트워크 성능·비용 효율의 발전을 앞질렀다.
  • "Challenges and Research Directions for Large Language Model Inference Hardware" (2026) — arXiv:2601.05047 — 언어모델 추론의 주된 과제는 계산보다 메모리와 연결이다. HBM에 준하는 대역폭으로 용량을 10배 늘리는 고대역폭 플래시 등 네 연구 방향을 제시한다.
  • "Thermo-Mechanical Reliability Characteristics of 8H HBM3" (2024) — DOI: 10.1109/irps48228.2024.10529424 — 인공지능·HPC 서버 수요로 HBM 쓰임이 크게 늘었다. HBM은 8층(8H)에서 12층(12H)까지 D램을 TSV로 쌓으며 H는 높이를 뜻한다. 패키지당 HBM 수는 2~4개에서 6~8개로 늘고 있다.
📚 반도체 첫걸음 — 뉴스 속 반도체 말을 처음 듣는 사람을 위해
4 / 4
  1. 1.트랜지스터는 스위치다 — 전기로 여닫는 아주 작은 수도꼭지
  2. 2.「3나노」는 무엇의 길이인가 — 34평형 집을 줄자로 재면
  3. 3.노광 — 빛의 붓으로 회로를 그리는 법
  4. 4.계산보다 나르기가 느리다 — 메모리 병목과 HBM
← 이전 글노광 — 빛의 붓으로 회로를 그리는 법

이 글은 AI가 연구 논문을 바탕으로 작성한 교육·정보 제공용 콘텐츠이며, 전문가의 조언을 대체하지 않습니다. 오류를 발견하셨나요? 알려주세요

© 2026 네오쿤스(Paperis) · 링크 공유는 환영합니다. 전문 전재·재배포는 사전 허가가 필요합니다.