⚡ BREAKING
Perangkat Keras & InferensiModel 🇷🇺 27.07.2026 17:04

NVIDIA Blackwell Ultra: 15 Pflops NVFP4, 288 GB HBM3e, tanpa FP64

NVIDIANVIDIA Taiwan Semiconductor Manufacturing CompanyTaiwan Semiconductor Manufacturing Company
NVIDIA meluncurkan akselerator Blackwell Ultra, yang memiliki 208 miliar transistor, 15 Pflops dalam NVFP4, memori HBM3e 288 GB, dan Tensor Core generasi kelima yang baru. Chip ini menghilangkan FP64 tetapi memperkenalkan format NVFP4 untuk inferensi AI yang efisien.
NVIDIA merinci akselerator Blackwell Ultra, versi yang disempurnakan dari arsitektur Blackwell. Chip ini terdiri dari dua die dengan 208 miliar transistor pada proses TSMC 4NP, terhubung melalui NV-HBI dengan bandwidth 10 TB/s. Ini mencakup 160 streaming multiprosesor dengan 640 Tensor Core generasi kelima yang memberikan 15 Pflops dalam NVFP4 (tanpa sparsity) dan cache L2 terpadu. Setiap SM memiliki 128 core CUDA, 4 Tensor Core dengan Transformer Engine generasi kedua, 256 KB Tensor Memory (TMEM), dan unit fungsi khusus. Format NVFP4 yang baru menggunakan skala mikro-blok FP8 dan skala level tensor FP32, mencapai akurasi mendekati FP8 dengan memori 1,8 kali lebih sedikit. Blackwell Ultra meningkatkan kinerja lapisan perhatian dengan menggandakan throughput SFU untuk softmax, mengurangi waktu untuk token pertama. Memori adalah 288 GB HBM3e (bandwidth 8 TB/s), peningkatan 50% dibandingkan Blackwell, memungkinkan model besar dengan lebih dari 300 miliar parameter. Konektivitas eksternal mencakup NVLink 5 (1,8 TB/s) dan PCIe 6.0 x16. Superchip Grace Blackwell Ultra menggabungkan satu CPU Grace dengan dua Blackwell Ultra, menawarkan hingga 40 Pflops NVFP4 dengan sparsity dan 1 TB memori terpadu. Sistem rak GB300 NVL72 mengintegrasikan 36 superchip untuk 1,1 Exaflops FP4.
Sumber: ServerNews — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru