PE Notes · CA/OS
GPU vs TPU
수천 소형 코어의 GPU와 행렬 전용 TPU를 가르고, GPGPU·매니코어·뉴로모픽과 멀티 GPU 병렬을 정리합니다.
그림 그리던 칩이 행렬을 먹게 된 이유는 같은 연산을 수천 갈래로 펼 수 있어서입니다. 는 작은 코어를 많이 모아 부동소수점 병렬에 강합니다. 는 텐서 곱만 보도록 깎은 ASIC입니다. CPU가 제어와 직렬을 맡는 동안, 학습은 GPU, 대규모 추론·배치 학습은 TPU가 전력 대비 연산에서 앞서는 경우가 많습니다.
세 프로세서
CPU는 코어 수가 적고 제어가 두껍습니다. GPU는 수천에서 수만의 단순 코어와 넓은 ·HBM을 둡니다. TPU는 시스톨릭 배열의 행렬 유닛이 중심이고, 활성화는 벡터 유닛이 받습니다. 프로그래밍은 한쪽이 C·파이썬, 다른 쪽이 ·OpenCL, TPU 쪽은 컴파일러 스택입니다.
| 비교축 | CPU | GPU | TPU |
|---|---|---|---|
| 코어 | 수~수십, 두꺼움 | 수천~, 얇음 | 행렬 유닛 |
| 특화 | 제어·분기 | 병렬 FP | INT8·BF16 곱 |
| 메모리 | DDR | HBM | HBM |
| 적합 | OS·직렬 | 학습·렌더 | 추론·배치 |
는 그래픽이 아닌 과학·학습에 GPU를 쓰는 이름입니다. 매니코어는 그 수천 얇은 코어 조직이고, 멀티코어 CPU의 두꺼운 소수 코어와 반대입니다. 공유 캐시는 작고, 같은 명령이 많은 데이터에 내려갑니다.
여러 장, 그리고 다른 칩
한 장에 모델이 안 들어가면 나눕니다. 은 배치를 카드마다 쪼개 기울기를 모읍니다. 모델 병렬은 층을 나눕니다. 은 한 행렬을 카드 사이에 자릅니다. 카드 사이는 가 받칩니다.
은 뉴런·시냅스를 소자로 흉내 냅니다. 처럼 사건이 있을 때만 계산해 전력이 크게 떨어지나, 도구 사슬은 아직 얇습니다. 같은 전산실에서 와 TPU는 효율을, GPU는 범용 학습을 맡습니다. 데이터센터와 전력 노트는 PUE와 냉각으로 이어집니다.
답안은 CPU·GPU·TPU 표, GPGPU, 매니코어≠멀티코어, 세 병렬, 뉴로모픽 한 줄을 한 장에 닫습니다.