NVIDIA Groq 3 : SRAM, dissociation et déterminisme dans la nouvelle plateforme IA
Après avoir acquis Groq pour 20 milliards de dollars, NVIDIA a intégré les accélérateurs LPU dans la plateforme Vera Rubin, créant ainsi une architecture hétérogène pour l'inférence. Le nouvel accélérateur rack LPX Groq 3, basé sur les puces Groq 3 LP30 avec 500 Mo de SRAM et 150 To/s de bande passante mémoire, assure une exécution déterministe et une faible latence. La dissociation par phase du décodage (AFD) permet de séparer les calculs FFN de l'attention, répartissant la charge de travail entre GPU et LPU.
NVIDIA
Groq
