NVIDIA Blackwell Ultra: NVFP4, 15 Petaflops and 288 GB HBM3e, but No FP64
NVIDIA
Taiwan Semiconductor Manufacturing Company
NVIDIA has revealed details about the Blackwell Ultra accelerator: the chip has 208 billion transistors, 160 SMs, 640 fifth-generation tensor cores, supports the new NVFP4 format, and is equipped with 288 GB of HBM3e. The throughput of NVFP4 computations has reached 15 petaflops, and the company has abandoned FP64 development.
NVIDIA가 Blackwell Ultra 아키텍처의 세부 사항을 공개했습니다. 이는 Blackwell 가속기의 업데이트 버전으로, NV-HBI 인터페이스(10TB/s)로 연결된 두 개의 다이로 구성되어 있습니다. TSMC 4NP 공정으로 제조된 2080억 개의 트랜지스터를 포함하며, 160개의 스트리밍 멀티프로세서(SM)와 640개의 5세대 텐서 코어, 2세대 Transformer Engine을 갖추고 있습니다. 희소성 없는 NVFP4에서의 성능은 15 PFLOPS에 달합니다. 각 SM은 128개의 CUDA 코어, 4개의 텐서 코어, 256KB의 텐서 메모리(TMEM)를 포함합니다. 새로운 NVFP4 형식은 FP8 마이크로블록 스케일링과 텐서 수준의 FP32 스케일링을 사용하여 FP8에 가까운 정밀도를 제공하면서도 FP8 대비 메모리 소비를 1.8배, FP16 대비 최대 3.5배 절감합니다. 메모리 서브시스템은 288GB의 HBM3e(8TB/s 대역폭)를 포함합니다. 어텐션 레이어의 소프트맥스 연산은 SFU 대역폭이 두 배로 증가하여 가속화되었습니다. 외부 통신은 NVLink 5(1.8TB/s, 도메인당 최대 576 GPU) 및 PCIe 6.0 x16으로 제공됩니다. Grace Blackwell Ultra 슈퍼칩은 Grace 프로세서와 두 개의 Blackwell Ultra 가속기를 결합하여 희소성 기준 최대 40 PFLOPS 및 1TB 통합 메모리를 제공합니다. GB300 NVL72 시스템은 36개의 슈퍼칩을 통합하여 FP4에서 1.1 EFLOPS를 달성합니다. NVIDIA는 FP64 개발을 사실상 포기했다고 밝혔습니다.
출처: ServerNews —
원문
