PE Notes · CA/OS
HBM
DRAM을 TSV로 수직 적층해 버스폭을 넓힌 HBM을 GDDR·LPDDR과 가르고, 메모리 월과 AI 가속기 대역폭 병목을 정리합니다.
연산이 빨라져도 데이터가 늦게 오면 칩은 기다립니다. 은 DRAM 다이를 위로 쌓고 로 수직 연결해, 기판 위 넓은 버스로 그 기다림을 줄입니다. JEDEC이 세대를 표준으로 닫고, GPU·FPGA·AI 가속기가 주 자립니다. 목표는 용량만이 아니라 스택당 버스폭과 와트당 이동입니다.
왜 위로 쌓는가
은 연산 속도와 메모리 대역이 벌어지는 현상입니다. 거대 언어 모델은 파라미터와 활성값이 한 카드의 평면 DRAM을 넘기고, GDDR의 버스폭(흔히 384비트 근처)은 그 벽을 잘 못 넘습니다. HBM은 스택당 1024비트급으로 그 폭을 엽니다. 이동 거리가 짧아 전력도 내려갑니다. 값은 비싸고, 공급이 학습 수요를 못 따라가면 그 자체가 병목이 됩니다.
| 비교축 | HBM3E | GDDR6X | LPDDR5 |
|---|---|---|---|
| 대역 감각 | 스택당 ~1.2 TB/s | 합산 ~1 TB/s | ~68 GB/s |
| 버스폭 | 1024 bit/스택 | 384 bit | 64 bit |
| 연결 | TSV + | PCB | PCB |
| 전력 | 이동 거리 짧음 | 중간 | 단말 저전력 |
| 자리 | AI GPU·HPC | 게임 GPU | 모바일 |
세대는 스택당 대역과 단수가 같이 올라갑니다. HBM1은 128 GB/s·4단, HBM2는 256 GB/s·8단, HBM2E는 460 GB/s, HBM3는 665 GB/s·12단, HBM3E는 1.2 TB/s에 12~16단입니다. 숫자는 세대 감각이지, 카드 전체 합산과 한 줄로 섞지 않습니다.
패키지와 가속기
베이스는 로직 다이입니다. 그 위에 DRAM이 반복되고, TSV가 층을 관통합니다. 인터포저(실리콘·유리)가 스택과 GPU/CPU를 한 패키지로 잇습니다. 평면 PCB 배선보다 채널이 많고 짧습니다. 카드 의 실체가 이 스택인 경우가 많습니다.
학습·추론에서 토큰을 만드는 속도는 종종 연산보다 대역에 붙습니다. 파라미터가 한 카드에 올라가면 통신이 줄고, 넘치면 모델 병렬과 가 옆 칸입니다. 소켓 DRAM을 더 붙이는 일은 CXL 메모리 풀이 이어 받고, 센터 전력은 AI 데이터센터 노트가 받습니다. 국내 양산은 고단 스택과 수율이 경쟁 축입니다.
| 보는 것 | 한 줄 |
|---|---|
| 버스폭 | 스택을 넓혀 월을 넘는다 |
| TSV | 수직 비아로 거리를 줄인다 |
| 용량 | 대형 파라미터를 카드 안에 둔다 |
| 대가 | 가격·수율·공급 |
답안은 정의(적층+TSV), GDDR 대비 표, 세대 한 줄, 가속기 대역 병목을 한 장에 닫습니다.