NVIDIA Groq 3: SRAM, disaggregatie en determinisme in het nieuwe AI-platform
Na de overname van Groq voor 20 miljard dollar heeft NVIDIA LPU-versnellers geïntegreerd in het Vera Rubin-platform, wat resulteert in een heterogene architectuur voor inferentie. De nieuwe Groq 3 LPX-rackversneller, gebaseerd op Groq 3 LP30-chips met 500 MB SRAM en 150 TB/s geheugenbandbreedte, zorgt voor deterministische uitvoering en lage latentie. Op fases gebaseerde uitsplitsing van decodering (AFD) maakt het mogelijk om FFN-berekeningen van aandacht te scheiden, waarbij de werklast wordt verdeeld tussen GPU's en LPU's.
NVIDIA
Groq
