⚡ EN DIRECT

NVIDIA Groq 3 : SRAM, désagrégation et déterminisme dans la nouvelle plateforme IA

NVIDIANVIDIA GroqGroq
L'acquisition de Groq par NVIDIA pour 20 milliards de dollars a abouti à l'intégration des accélérateurs LPU dans la plateforme Vera Rubin, permettant une inférence IA désagrégée et hétérogène. Le nouveau système rack Groq 3 LPX combine 256 LPU pour une génération de jetons rapide et déterministe, tandis que Vera Rubin NVL72 gère l'entraînement et l'inférence flexibles. La plateforme cible les applications interactives à faible latence et les charges de travail multi-agents, promettant des performances jusqu'à 35 fois plus rapides que Grace Blackwell NVL72 à 400 TPS par utilisateur.
NVIDIA a intégré l'architecture LPU (Language Processing Unit) de Groq dans sa plateforme d'IA Vera Rubin à la suite du rachat de 20 milliards de dollars. Il en résulte un système hétérogène où le Vera Rubin NVL72 assure l'entraînement et l'inférence généralistes, tandis que l'accélérateur rack Groq 3 LPX fournit un moteur spécialisé pour la génération de tokens à faible latence. Le LPX contient 256 puces Groq 3 (LP30) dotées chacune de 96 milliards de transistors, interconnectées via RealScale C2C. Le LPU est conçu autour d'un modèle d'exécution déterministe avec 500 Mo de SRAM par puce (bande passante de 150 To/s), sans caches, et un déplacement explicite des données contrôlé par un compilateur. Cela élimine la gigue et garantit une latence prévisible, cruciale pour l'IA interactive et les systèmes multi-agents. La plateforme utilise le désagrégement de phases (AFD) séparant les opérations d'attention et de FFN : le GPU gère le préremplissage et l'attention sur longs contextes, tandis que le LPU accélère le décodage FFN/MoE. NVIDIA revendique une accélération jusqu'à 35 fois par rapport au Grace Blackwell NVL72 à 400 TPS par utilisateur, et un revenu par MW jusqu'à 10 fois supérieur pour les charges de travail sensibles à la latence. Le logiciel NVIDIA Dynamo orchestre le décodage hétérogène, classifie les requêtes et gère les activations intermédiaires.
Source: ServerNews — original
Nos articles précédents sur ce sujet ↓
Infos fraîches