⚡ BREAKING

NVIDIA Groq 3: SRAM, hajautus ja determinismi uudessa AI-alustassa

NVIDIANVIDIA GroqGroq
Hankittuaan Groqin 20 miljardilla dollarilla NVIDIA integroi LPU-kiihdyttimet Vera Rubin -alustaan luoden heterogeenisen arkkitehtuurin päättelyä varten. Uusi Groq 3 LPX -telakkakiihdytin, joka perustuu Groq 3 LP30 -siruihin, joissa on 500 megatavua SRAM-muistia ja 150 teratavua sekunnissa muistikaistanleveyttä, takaa deterministisen suorituksen ja alhaisen viiveen. Vaihepohjainen dekoodauksen hajautus (AFD) mahdollistaa eteenpäin suuntautuvan neuroverkon laskutoimitusten ja huomiomekanismin erottamisen toisistaan jakaen työkuormaa grafiikkaprosessointiyksiköiden ja loogisten prosessointiyksiköiden välillä.
NVIDIA on saattanut päätökseen historiansa suurimman kaupan, hankkien Groqin 20 miljardilla dollarilla, ja integroinut arkkitehtuurisesti erilaiset LPU-piireihin perustuvat tekoälyn kiihdyttimet Vera Rubin -alustalleen nopeuttaakseen päättelyä, hajauttaen sen ja tehden alustasta heterogeenisen. Uusi 160 kW:n tehoinen NVIDIA Groq 3 LPX -telinekiihdytin sisältää 256 Groq 3 (LP30) -tekoälypiiriä, joissa jokaisessa on 96 miljardia transistoria, yhdistettynä 32:een 1U-korkeuteen nestejäähdytyksellä ja MGX-kaapelittomalla rakenteella. Groq 3 LPU -piiri perustuu 500 megatavun SRAM-muistiin, jonka kaistanleveys on 150 teratavua sekunnissa, ilman välimuisteja tai hierarkiaa, mahdollistaen tiedon nimenomaisen siirron kääntäjän hallinnassa. LPU:n määrittelevä ominaisuus on determinismi – suorituskyvyn vaihtelun puuttuminen siirtämällä kaikki päätökset kääntäjälle ja käyttämällä pleesiokronista C2C-protokollaa. Keskeinen innovaatio on vaiheittain hajautettu dekoodaus (AFD), joka erottaa GPU:lla suoritettavan huomiomekanismin LPX:llä käsiteltävistä FFN/MoE-operaatioista. Tämä mahdollistaa GPU:n imeä kasvavia kontekstin määriä, kun LPU:n kuormitus pysyy vakiona eikä riipu kontekstin pituudesta. Käytännön heterogeenisen dekoodauksen mahdollistamiseksi NVIDIA Dynamo huolehtii kyselyiden orkestroinnista, työnjaosta ja vakaan viiveen ylläpitämisestä vilkkaassa liikenteessä. Yhdistelmänä Vera Rubin NVL72 ja Groq 3 LPX tarjoavat 35 kertaa suuremman läpäisykyvyn verrattuna Grace Blackwell NVL72:een 400 transaktiolla sekunnissa käyttäjää kohden, ja jopa 10 kertaa suuremman tulon megawattia kohden viiveherkissä kuormissa.
Lähde: ServerNews — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset