PE Notes · CA/OS
PNM과 칩렛
메모리 근처에서 연산하는 PNM을 PIM·기존 버스와 가르고, 작은 다이를 잇는 칩렛과 UCIe·CoWoS를 정리합니다.
행렬을 곱하는 시간보다, 그 숫자를 칩 밖으로 옮기는 시간이 더 길 때가 있습니다. 이 간극이 입니다. (Processing Near Memory)은 데이터를 프로세서 쪽으로 끌어오지 않고, 메모리 근처 레이어에서 계산한 뒤 결과만 올립니다. 큰 다이를 한 장으로 깎지 않고 작은 조각을 잇는 쪽이 입니다.
연산 자리
기존 경로는 CPU·GPU가 버스를 타고 DRAM을 읽습니다. 학습·추론에서 전력의 상당 부분이 이 이동에 쓰입니다. 은 DRAM 다이 안에 연산 유닛을 넣습니다. 이동은 거의 없으나 메모리 공정을 고쳐야 해서 구현이 어렵습니다. PNM은 캐시·버퍼처럼 메모리에 붙은 층에 유닛을 둡니다. 이동은 줄이고, 다이 수정은 PIM보다 덜합니다.
| 비교축 | 기존 | PIM | PNM |
|---|---|---|---|
| 자리 | CPU·GPU | DRAM 다이 안 | 메모리 근처 층 |
| 이동 | 많음 | 거의 없음 | 최소 |
| 전력 | 높음 | 매우 낮음 | 낮음 |
| 구현 | 쉬움 | 어려움 | 중간 |
명령은 프로세서가 내리고, 실제 곱·합은 PNM 유닛이 제자리에서 끝냅니다. 대역이 넓은 HBM 스택과 같이 쓰면 근처 연산의 효과가 커집니다. CXL로 메모리를 풀링하는 설계와도 같은 방향을 봅니다.
칩렛과 다리
무어의 법칙이 둔해지면 거대한 단일 다이의 수율은 떨어지고 값은 오릅니다. 칩렛은 코어 다이, 입출력 다이, 가속기, HBM을 각자 깎아 한 패키지에 올립니다. 작은 다이는 수율이 낫고, 공정이 다른 조각을 섞을 수 있습니다. 대가는 다이 사이 지연과 패키지 복잡도입니다. 다리가 표준이 아니면 조합이 막힙니다.
| 표준 | 주도 | 한 줄 |
|---|---|---|
| 개방 연합 | PCIe 감각의 칩렛 링크 | |
| EMIB | Intel | 짧은 브리지 다이 |
| TSMC | 실리콘 인터포저, HBM을 옆에 붙임 |
실무 그림은 CPU 다이·GPU 다이·HBM이 UCIe나 CoWoS 위에 앉는 패키지입니다. 서버 CPU가 코어 칩렛과 I/O 다이를 가르고, 가속기는 인터포저 위에 HBM을 붙입니다. 답안은 PNM≠PIM, 이동·전력 표, 칩렛 장단, UCIe·CoWoS를 한 장에 닫습니다.