⚡ EN DIRECT
NVIDIA Blackwell Ultra : 15 Pflops NVFP4, 288 Go HBM3e, pas de FP64
NVIDIA
Taiwan Semiconductor Manufacturing Company
NVIDIA a dévoilé l'accélérateur Blackwell Ultra, doté de 208 milliards de transistors, 15 Pflops en NVFP4, 288 Go de mémoire HBM3e et de nouveaux Tensor Cores de cinquième génération. La puce omet le FP64 mais introduit le format NVFP4 pour une inference IA efficace.
NVIDIA a présenté l'accélérateur Blackwell Ultra, une version améliorée de l'architecture Blackwell. La puce est composée de deux dies avec 208 milliards de transistors sur le processus TSMC 4NP, connectés via NV-HBI avec une bande passante de 10 To/s. Elle comprend 160 multiprocesseurs de flux avec 640 cœurs Tensor de cinquième génération délivrant 15 Pflops en NVFP4 (sans sparsité) et un cache L2 unifié. Chaque SM possède 128 cœurs CUDA, 4 cœurs Tensor avec le moteur Transformer de deuxième génération, 256 Ko de mémoire Tensor (TMEM) et des unités de fonctions spéciales. Le nouveau format NVFP4 utilise un micro-bloc de mise à l'échelle FP8 et une mise à l'échelle au niveau tensorial FP32, atteignant une précision proche de FP8 avec 1,8 fois moins de mémoire. Blackwell Ultra améliore les performances de la couche d'attention en doublant le débit des SFU pour le softmax, réduisant ainsi le temps jusqu'au premier jeton. La mémoire est de 288 Go HBM3e (bande passante de 8 To/s), soit une augmentation de 50 % par rapport à Blackwell, permettant d'exécuter de grands modèles avec plus de 300 milliards de paramètres. La connectivité externe comprend NVLink 5 (1,8 To/s) et PCIe 6.0 x16. Le superchip Grace Blackwell Ultra associe un CPU Grace à deux Blackwell Ultra, offrant jusqu'à 40 Pflops NVFP4 avec sparsité et 1 To de mémoire unifiée. Le système rack GB300 NVL72 intègre 36 superchips pour 1,1 Exaflops FP4.
Source: ServerNews —
original
