⚡ BREAKING
NVIDIA Groq 3: SRAM, disaggregatie en determinisme in het nieuwe AI-platform
NVIDIA
Groq
Na de overname van Groq voor 20 miljard dollar heeft NVIDIA LPU-versnellers geïntegreerd in het Vera Rubin-platform, wat resulteert in een heterogene architectuur voor inferentie. De nieuwe Groq 3 LPX-rackversneller, gebaseerd op Groq 3 LP30-chips met 500 MB SRAM en 150 TB/s geheugenbandbreedte, zorgt voor deterministische uitvoering en lage latentie. Op fases gebaseerde uitsplitsing van decodering (AFD) maakt het mogelijk om FFN-berekeningen van aandacht te scheiden, waarbij de werklast wordt verdeeld tussen GPU's en LPU's.
NVIDIA heeft de grootste overname uit zijn geschiedenis afgerond door Groq voor 20 miljard dollar te kopen en heeft de architectonisch vreemde AI-versnellers LPU geïntegreerd in zijn Vera Rubin-platform om de inferentie drastisch te versnellen, deze te ontkoppelen en het platform heterogeen te maken. De nieuwe rackversneller NVIDIA Groq 3 LPX met een vermogen van 160 kW bevat 256 AI-chips Groq 3 (LP30) met elk 96 miljard transistors, samengevoegd in 32 1U-hoge nodes met vloeistofkoeling en een kabelvrije MGX-constructie. De Groq 3 LPU-chip is gebouwd op SRAM-geheugen van 500 MB met een bandbreedte van 150 TB/s, zonder caches of hiërarchie, wat expliciete gegevensverplaatsing onder compilercontrole mogelijk maakt. Het bepalende kenmerk van de LPU is determinisme: geen variabiliteit tijdens uitvoering doordat alle beslissingen naar de compiler worden verplaatst en een pleisochroon C2C-protocol wordt gebruikt. De belangrijkste innovatie is de faseontkoppeling van decodering (AFD), die het aandachtsmechanisme, dat op GPU's draait, scheidt van de FFN/MoE-bewerkingen die op de LPX worden verwerkt. Dit stelt GPU's in staat om groeiende contextvolumes te absorberen, terwijl de belasting van de LPU constant blijft en onafhankelijk is van de contextlengte. Voor praktisch gebruik van heterogene decodering zorgt NVIDIA Dynamo voor de orkestratie van verzoeken, taakverdeling en het handhaven van stabiele latentie bij intensief verkeer. In combinatie met Vera Rubin NVL72 levert Groq 3 LPX een 35 keer hogere doorvoer vergeleken met Grace Blackwell NVL72 bij 400 TPS per gebruiker, en tot 10 keer meer inkomsten per MW voor latentiegevoelige workloads.
Bron: ServerNews —
origineel
