⚡ EILMELDUNG
NVIDIA Groq 3: SRAM, Disaggregation und Determinismus in der neuen KI-Plattform
NVIDIA
Groq
Die 20 Milliarden Dollar teure Übernahme von Groq durch NVIDIA hat zur Integration von LPU-Beschleunigern in die Vera-Rubin-Plattform geführt, die eine entkoppelte, heterogene KI-Inferenz ermöglicht. Das neue Groq-3-LPX-Rack-System kombiniert 256 LPUs für schnelle, deterministische Token-Generierung, während Vera Rubin NVL72 flexible Trainings- und Inferenzaufgaben übernimmt. Die Plattform zielt auf latenzarme interaktive KI und Multi-Agent-Workloads ab und verspricht bis zu 35-mal schnellere Leistung als Grace Blackwell NVL72 bei 400 TPS pro Benutzer.
NVIDIA hat nach der 20-Milliarden-Dollar-Übernahme die LPU-Architektur (Language Processing Unit) von Groq in seine KI-Plattform Vera Rubin integriert. Das Ergebnis ist ein heterogenes System, bei dem Vera Rubin NVL72 allgemeines Training und Inferenz übernimmt, während der Groq-3-LPX-Rack-Beschleuniger eine spezialisierte Engine für latenzarme Token-Generierung bereitstellt. Der LPX enthält 256 Groq-3-Chips (LP30) mit jeweils 96 Milliarden Transistoren, die über eine RealScale-C2C-Verbindung verbunden sind. Die LPU basiert auf einem deterministischen Ausführungsmodell mit 500 MB SRAM pro Chip (150 TB/s Bandbreite), ohne Caches und mit expliziter Datenbewegung, die vom Compiler gesteuert wird. Dies eliminiert Jitter und gewährleistet vorhersagbare Latenzen, die für interaktive KI und Multi-Agenten-Systeme entscheidend sind. Die Plattform nutzt Phasen-Disaggregation (AFD), bei der Attention- und FFN-Operationen getrennt werden: Die GPU übernimmt Prefill und Long-Context-Attention, während die LPU die FFN/MoE-Dekodierung beschleunigt. NVIDIA gibt eine bis zu 35-fache Beschleunigung gegenüber Grace Blackwell NVL72 bei 400 Transaktionen pro Sekunde (TPS) pro Benutzer und einen bis zu zehnfachen Umsatz pro Megawatt für latenzempfindliche Workloads an. Die NVIDIA-Dynamo-Software orchestriert die heterogene Dekodierung, klassifiziert Anfragen und verwaltet zwischenzeitliche Aktivierungen.
Quelle: ServerNews —
Original
