Google DiffusionGemma: Tekninen raportti selittää nopean tekstidiffuusiomallin
Google/DeepMind
NVIDIA
Google DeepMind on julkaissut teknisen raportin DiffusionGemma-mallista, joka on tekstidiffuusiomalli ja tuottaa 256 tokenia rinnakkain saavuttaen noin 1 500 tokenia sekunnissa Nvidia H100 -prosessorilla. Malli on luotu muuntamalla olemassa oleva Gemma 4 -malli diffuusiomalliksi, ja sen harjoittamiseen on käytetty alle 10 prosenttia alkuperäisestä tokenien harjoitusbudjetista. Raportissa tuodaan esiin sekä mallin vahvuuksia, kuten itsensä korjaaminen, että sen rajoituksia päättelyssä ja usean käyttäjän suorituskyvyssä.
Google DeepMind on julkaissut teknisen raportin DiffusionGemma-mallista, joka julkaistiin kesäkuun puolivälissä ja joka tuottaa tekstiä jalostamalla 256 tokenin lohkoja rinnakkain, samaan tapaan kuin kuvien generointi kohinasta. Nvidian H100-kiihdyttimellä se saavuttaa noin 1500 tokenia sekunnissa. Sen sijaan, että malli olisi koulutettu alusta alkaen, olemassa oleva Gemma-4-26B-A4B-malli muunnettiin diffuusiomalliksi käyttämällä alle kymmentä prosenttia alkuperäisestä koulutusbudjetista. Koulutus sisälsi kaksi vaihetta: ensin opittiin rekonstruoimaan kohinaisia tekstilohkoja, sitten yhdistettiin vahvistusoppiminen ja näytteenottimen tislaus, jota Google kutsuu SD·RL:ksi. Raportin mukaan tämä parantaa päättelyvertailuarvoja keskimäärin kymmenellä pisteellä samalla kun tokenien määrä askelta kohti lähes nelinkertaistuu ja vastaukset ovat noin 50 prosenttia lyhyempiä. DiffusionGemman kaksisuuntainen käsittely mahdollistaa itsekorjauksen ennen tulostusta, mikä mahdollistaa Sudoku-pulmien ratkaisemisen 85 prosentin tarkkuudella hienosäädön jälkeen, kun perusmalli epäonnistuu. Se säilyttää myös kyvyn tuottaa tekstiä sana kerrallaan, jolloin käyttäjät voivat vaihtaa tiloja. Absoluuttinen suorituskyky on kuitenkin autoregressiivista mallia heikompi muun muassa jälkikäteen tehdyn muunnoksen ja nopeuteen tähdänneen lyhyen koulutusvaiheen vuoksi. Malli joutuu toisinaan toistuviin silmukoihin ja saattaa jättää päättelyosiot sulkematta, mikä laskee vertailuarvojen pisteitä. Nopeusetu pätee lähinnä yksittäisen käyttäjän skenaarioissa, sillä autoregressiiviset mallit saavuttavat sen läpäisyn suhteen yli 32:n samanaikaisen pyynnön kohdalla. Google esittää DiffusionGemman kokeellisena, tavoitteenaan nopeuttaa tutkimusta ja tarjota pohja erikoistuneille sovelluksille. Sitä käyttää jo startup Interfaze monikielisessä puheentunnistuksessa ja projektissa vuorovaikutteisten radiologiaraporttien tuottamiseen. Malli on saatavilla Apache 2.0 -lisenssillä Hugging Facessa, ja sen edeltäjä Gemini Diffusion esiteltiin toukokuussa 2025.
Lähde: The Decoder (DE) —
Alkuperäinen
