PE Notes · AI
AI 슈퍼컴퓨팅 플랫폼
수천 GPU를 고속 인터커넥트로 묶어 거대 모델을 학습하는 전용 인프라입니다. 가속기·NVLink·InfiniBand와 데이터·텐서·파이프라인 병렬, ZeRO 샤딩을 정리합니다.
수천억 파라미터를 수조 토큰으로 돌리면 일반 클러스터는 연 단위가 됩니다. 병목은 세 곳입니다. 행렬 연산, 단일 GPU 을 넘는 파라미터, GPU 사이 기울기 동기화입니다. 은 가속기, 인터커넥트, 분산 스토리지, 분산 학습 소프트웨어를 한 목적으로 묶은 인프라입니다.
정의
전통 HPC는 FP64 수치 시뮬레이션과 CPU가 중심입니다. AI 슈퍼컴은 FP16/BF16/FP8 행렬과 GPU·, HBM이 중심입니다. 지표도 FLOPS(FP64)가 아니라 TFLOPS(FP16)·TOPS입니다.
| 비교축 | 전통 HPC | AI 슈퍼컴퓨터 |
|---|---|---|
| 연산 | 수치 시뮬레이션 (FP64) | 행렬 곱 (FP16/BF16/FP8) |
| 부품 | CPU + 인터커넥트 | GPU/NPU + HBM + NVLink |
| 지표 | FP64 FLOPS | FP16 TFLOPS, INT8 TOPS |
노드 안 GPU–GPU는 (수 세대 기준 수백 GB/s급), 노드 사이는 (NDR 400Gb/s급)입니다. 통신 라이브러리는 의 AllReduce입니다. 스토리지는 Lustre/GPFS급 병렬 파일시스템입니다. 가속기는 범용 GPU, 전력 효율을 보는 NPU/TPU, 메모리 안 연산(PIM)으로 나눕니다.
병렬화
은 미니배치를 GPU마다 나누고 기울기를 평균합니다. 모델이 GPU 하나에 들어가야 합니다. 모델 병렬은 층을 나눕니다. 은 행렬 자체를 쪼개고, 은 층 블록을 스테이지로 잇습니다.
는 파라미터·옵티마이저 상태·기울기를 GPU 사이에 샤딩합니다. ZeRO-3는 파라미터까지 나눠, 단일 카드보다 훨씬 큰 망을 올립니다. 추론 쪽 지연은 와 경량 토픽으로 이어집니다.
운영
전력이 수십 MW로 가고, 공랭이 한계면 수랭·액침으로 바꿉니다. GPU 유휴를 스케줄러(SLURM, Kubernetes)로 줄입니다. 체크포인트 무결성과 학습 데이터 유출이 보안 층입니다.
클라우드 온디맨드 클러스터와 온프레미스 전용 랙을 같은 표에 두면, 탄력과 데이터 주권이 갈립니다. 온디바이스 추론과는 학습 규모가 다릅니다. 국내 국가 AI 컴퓨팅 센터와 해외 연구 인프라 구축은 같은 병목(연산·전력·인재)을 공공 쪽으로 여는 움직임입니다.
| 비교축 | 데이터 병렬 | 텐서 병렬 | 파이프라인 병렬 |
|---|---|---|---|
| 나누는 것 | 미니배치 | 한 층 안의 행렬 | 층 블록(스테이지) |
| 통신 | 기울기 AllReduce | 부분 곱 교환 | 활성화 전달 |
| 한계 | 모델이 한 GPU에 들어가야 함 | 구현이 무겁다 | 파이프 버블 |
기출 이력
제140회 정보관리기술사 2교시
관련 용어
관련 토픽
AI
클라우드 AI vs 온디바이스 AI
원격 서버 추론과 단말 로컬 추론을 지연·프라이버시·모델 규모·비용으로 비교하고, 경량화와 NPU를 전제로 한 하이브리드 선택을 정리합니다.
AI
KV 캐시 (Key-Value Cache)
오토리그레시브 생성에서 이미 계산한 Key·Value를 저장해 재계산을 없애는 KV 캐시의 프리필·디코딩, 메모리 최적화, 속도와 보안 트레이드오프를 정리합니다.
AI
sLLM — Smaller Large Language Model
초거대 LLM을 증류·양자화·가지치기로 줄여, 온프레미스와 온디바이스에서 낮은 지연으로 쓰는 소형 언어모델의 위치와 한계를 정리합니다.