MallitAvoin lähdekoodi 🇺🇸 27.07.2026 12:02

DiffusionGemma: Tekstin tuottaminen jopa neljä kertaa nopeammin

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind on esitellyt DiffusionGemma-nimisen kokeellisen avoimen mallin, joka perustuu tekstidiffuusioon. Malli tuottaa kokonaisia tekstilohkoja samanaikaisesti, saavuttaen jopa nelinkertaisen nopeuden verrattuna autoregressiivisiin suuriin kielimalleihin. Se on suunniteltu tutkijoille ja kehittäjille, jotka työskentelevät paikallisissa, viivekriittisissä skenaarioissa.
Google DeepMind ilmoitti DiffusionGemma -kokeellisesta avoimen lähdekoodin mallista (Apache 2.0 -lisenssin alla), joka käyttää tekstidiffuusiota generointiin. Toisin kuin perinteiset autoregressiiviset suuret kielimallit, jotka käsittelevät tunnuksia peräkkäin, DiffusionGemma tuottaa tekstilohkoja samanaikaisesti, saavuttaen jopa 4-kertaisen nopeutuksen grafiikkasuorittimella (yli 1000 tokenia sekunnissa yhdellä NVIDIA H100:lla ja yli 700 tokenia sekunnissa NVIDIA GeForce RTX 5090:llä). Malli käyttää mixture of experts -arkkitehtuuria (asiantuntijasekoitus, MoE), jossa on 26 miljardia parametria, mutta inferenssissä aktivoituu vain 3,8 miljardia, mikä mahdollistaa mahtumisen 18 gigatavuun videomuistia kvantisoinnin avulla. Keskeisiä ominaisuuksia ovat kaksisuuntainen huomio (256 tokenia per läpimeno), iteratiivinen itsekorjaus ja keskittyminen epälineaarisiin tehtäviin, kuten koodin muokkaus, aukkojen täyttö tai aminohapposekvenssien käsittely. Tuotoksen laatu on kuitenkin heikompi kuin tavallisessa Gemma 4:ssä. Kehittäjien, jotka tarvitsevat parasta tarkkuutta, kannattaa käyttää autoregressiivistä versiota. DiffusionGemma on erityisen tehokas paikallisessa inferenssissä, jossa on vähän kilpailua; pilvessä, jossa on suuri läpäisykyky, hyöty pienenee. Malli on jo ladattavissa Hugging Facesta, ja sitä tuetaan MLX:ssä, vLLM:ssä ja Hugging Face Transformersissa. Integraatio llama.cpp:n kanssa on suunnitteilla. DeepMind teki yhteistyötä NVIDIA:n kanssa optimoidakseen mallin kuluttaja- ja yritys-GPU:ille (GeForce RTX 5090/4090, Hopper, Blackwell, NVIDIA DGX Spark, DGX Station, RTX PRO). 4-bittinen NVFP4-muoto on tuettu nopeuttamaan toimintaa. Lisäksi on julkaistu kehittäjän opas, visuaalinen ohje ja opetusohjelma hienosäätöön käyttäen Hackable Diffusionia (JAX).
Lähde: Google DeepMind — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset