DiffusionGemma: 4x nopeampi tekstin tuottaminen
Google/DeepMind
DeepMind
NVIDIA
Google DeepMind on julkaissut DiffusionGemman, kokeellisen avoimen 26 miljardin parametrin asiantuntijoiden sekoitusmallin (Mixture of Experts -malli), joka käyttää tekstidiffuusiota tuottaakseen jopa 4 kertaa nopeammin kuin autoregressiiviset suuret kielimallit grafiikkasuorittimilla. Se käsittelee samanaikaisesti 256 tokenin lohkoja, suunnattuna nopeutta vaativiin paikallisiin työnkulkuihin, kuten rivinsisäiseen muokkaukseen, ja on julkaistu Apache 2.0 -lisenssillä Hugging Facessa.
Google DeepMind julkaisi DiffusionGemma-kokeellisen 26 miljardin parametrin Mixture of Experts (MoE) -mallin Apache 2.0 -lisenssillä. Malli saavuttaa jopa nelinkertaisen tekstin tuotantonopeuden käyttämällä diffuusiopohjaista menetelmää peräkkäisen tokenien ennustamisen sijaan. Se aktivoi vain 3,8 miljardia parametria kutakin päättelykertaa kohti, mahtuen 18 gigatavuun VRAM-muistia kvantisoituna, ja saavuttaa yli 1000 tokenia sekunnissa NVIDIA H100 -kiihdyttimellä ja yli 700 tokenia sekunnissa GeForce RTX 5090 -näytönohjaimella. Malli käyttää kaksisuuntaista huomiota tuottaakseen 256 tokenia rinnakkain, mikä mahdollistaa epälineaariset tehtävät, kuten koodin täydennykset ja Sudokun ratkaisemisen. DiffusionGemma on optimoitu paikalliseen vähäkuormitteiseen päättelyyn, jossa rinnakkainen dekoodaus tuottaa suurimman hyödyn, kun taas autoregressiiviset mallit toimivat paremmin korkean kyselytaajuuden pilvipalvelussa. Malli tarkentaa tuotostaan iteratiivisesti, ja sitä voidaan hienosäätää työkaluilla, kuten Unsloth, Hugging Face, vLLM, MLX, JAX ja NVIDIA NeMo, ja tuki llama.cpp:lle on tulossa. Google DeepMind teki yhteistyötä NVIDIA:n kanssa laitteisto-optimointien, kuten NVFP4-ydinten, osalta, ja malli on saatavilla Hugging Facessa, Gemini Enterprise Agent Platformissa ja NVIDIA NIM:ssä.
Lähde: Google DeepMind —
Alkuperäinen
