⚡ BREAKING
NVIDIA Groq 3: SRAM, hajautus ja determinismi uudella AI-alustalla
NVIDIA
Groq
NVIDIA:n 20 miljardin dollarin Groq-osto on johtanut LPU-kiihdyttimien integrointiin Vera Rubin -alustaan, mikä mahdollistaa hajautetun, heterogeenisen AI-päätelyn. Uusi Groq 3 LPX -telinejärjestelmä yhdistää 256 LPU:ta nopeaa, determinististä token-generointia varten, kun taas Vera Rubin NVL72 hoitaa joustavan koulutuksen ja päätelyn. Alusta on suunnattu matalan viiveen interaktiiviselle AI:lle ja monitoimiagenttityökuormille, ja se lupaa jopa 35 kertaa nopeampaa suorituskykyä kuin Grace Blackwell NVL72 400 TPS:llä käyttäjää kohti.
NVIDIA on integroinut Groq:n LPU-arkkitehtuurin (Language Processing Unit) Vera Rubin -tekoälyalustaansa 20 miljardin dollarin yritysoston jälkeen. Tuloksena on heterogeeninen järjestelmä, jossa Vera Rubin NVL72 hoitaa yleisen harjoituksen ja päättelyn, kun taas Groq 3 LPX -telinekiihdytin tarjoaa erikoistuneen moottorin matalan viiveen token-generointiin. LPX sisältää 256 Groq 3 (LP30) -piiriä, joissa kussakin on 96 miljardia transistoria, yhdistettynä RealScale C2C -liitännällä. LPU on suunniteltu deterministisen suoritusmallin ympärille, ja siinä on 500 megatavua SRAM-muistia per piiri (150 teratavua sekunnissa kaistanleveys), ei välimuisteja, ja eksplisiittinen tiedonsiirto, jota ohjaa kääntäjä. Tämä eliminoi värähtelyn ja takaa ennustettavan viiveen, mikä on olennaista interaktiiviselle tekoälylle ja moniagenttijärjestelmille. Alusta käyttää vaihe-erottelua (AFD), joka erottaa huomio- ja eteenpäinlaskennan toiminnot: GPU hoitaa esitäytön ja pitkän kontekstin huomion, kun taas LPU kiihdyttää FFN/MoE-dekoodausta. NVIDIA väittää jopa 35-kertaista nopeutusta Grace Blackwell NVL72:een verrattuna 400 tokenia sekunnissa per käyttäjä, ja jopa 10-kertaista liikevaihtoa megawattia kohden viiveherkille työkuormille. NVIDIA Dynamo -ohjelmisto orkestroi heterogeenisen dekoodauksen, luokittelee pyynnöt ja hallinnoi väliaktivaatioita.
Lähde: ServerNews —
Alkuperäinen
