⚡ EN DIRECT
NVIDIA Groq 3 : SRAM, dissociation et déterminisme dans la nouvelle plateforme IA
NVIDIA
Groq
Après avoir acquis Groq pour 20 milliards de dollars, NVIDIA a intégré les accélérateurs LPU dans la plateforme Vera Rubin, créant ainsi une architecture hétérogène pour l'inférence. Le nouvel accélérateur rack LPX Groq 3, basé sur les puces Groq 3 LP30 avec 500 Mo de SRAM et 150 To/s de bande passante mémoire, assure une exécution déterministe et une faible latence. La dissociation par phase du décodage (AFD) permet de séparer les calculs FFN de l'attention, répartissant la charge de travail entre GPU et LPU.
NVIDIA a conclu le plus gros rachat de son histoire en acquérant Groq pour 20 milliards de dollars, et a intégré les accélérateurs IA architecturalement différents LPU dans sa plateforme Vera Rubin pour accélérer massivement l'inférence, la rendant désagrégée et la plateforme hétérogène. Le nouvel accélérateur rack NVIDIA Groq 3 LPX d'une puissance de 160 kW contient 256 puces IA Groq 3 (LP30) avec 96 milliards de transistors chacune, regroupées en 32 nœuds de 1U avec refroidissement liquide et construction sans câble MGX. La puce Groq 3 LPU est construite sur une mémoire SRAM de 500 Mo avec une bande passante de 150 To/s, sans caches ni hiérarchie, permettant un déplacement explicite des données géré par le compilateur. La caractéristique déterminante du LPU est le déterminisme, c'est-à-dire l'absence de variabilité pendant l'exécution grâce au transfert de toutes les décisions au compilateur et à l'utilisation du protocole plésiochrone C2C (chip-to-chip). L'innovation clé est la désagrégation par phase du décodage (AFD, pour Aggressive Face Decoding), qui sépare le mécanisme d'attention exécuté sur les GPU des opérations FFN (feedforward network) et MoE (mixture of experts) traitées sur le LPX. Cela permet aux GPU d'absorber des volumes croissants de contexte, tandis que la charge sur les LPU reste constante et indépendante de la longueur du contexte. Pour une utilisation pratique du décodage hétérogène, NVIDIA Dynamo assure l'orchestration des requêtes, la répartition du travail et le maintien d'une latence stable sous trafic intense. En combinaison, le Vera Rubin NVL72 avec Groq 3 LPX offre un débit 35 fois supérieur à celui du Grace Blackwell NVL72 à 400 transactions par seconde (TPS) par utilisateur, et jusqu'à 10 fois plus de revenus par mégawatt pour les charges sensibles à la latence.
Source: ServerNews —
original
