NVIDIA Groq 3: SRAM, Disaggregation und Determinismus in der neuen KI-Plattform
Nach der Übernahme von Groq für 20 Milliarden US-Dollar integrierte NVIDIA die LPU-Beschleuniger in die Vera-Rubin-Plattform und schuf so eine heterogene Architektur für Inferenz. Der neue Groq-3-LPX-Rack-Beschleuniger, basierend auf Groq-3-LP30-Chips mit 500 MB SRAM und 150 TB/s Speicherbandbreite, gewährleistet deterministische Ausführung und niedrige Latenz. Die phasenbasierte Disaggregation der Dekodierung (AFD) ermöglicht die Trennung der FFN-Berechnungen von der Aufmerksamkeit und verteilt die Arbeitslast zwischen GPUs und LPUs.
NVIDIA
Groq
