ModellenOnderzoek 🇩🇪 09.08.2026 13:01

Google DiffusionGemma: technisch rapport legt het snelle tekstdiffusiemodel uit

Google/DeepMindGoogle/DeepMind NVIDIANVIDIA
Google DeepMind heeft een technisch rapport uitgebracht over DiffusionGemma, een tekstdiffusiemodel dat 256 tokens parallel genereert en ongeveer 1.500 tokens per seconde bereikt op een Nvidia H100. Het model is gecreëerd door het bestaande Gemma 4-model om te zetten naar een diffusiemodel met minder dan 10% van het oorspronkelijke trainingstokenbudget. Het rapport benadrukt zowel de sterke punten van het model, zoals zelfcorrectie, als de beperkingen op het gebied van redeneren en doorvoer bij meerdere gebruikers.
Google DeepMind heeft een technisch rapport gepubliceerd over DiffusionGemma, een model dat medio juni werd uitgebracht en dat tekst genereert door blokken van 256 tokens parallel te verfijnen, vergelijkbaar met het genereren van afbeeldingen uit ruis. Op Nvidia's H100-accelerator behaalt het ongeveer 1.500 tokens per seconde. In plaats van vanaf nul te trainen, is het bestaande Gemma-4-26B-A4B-model omgezet in een diffusiemodel met minder dan 10% van het oorspronkelijke trainingsbudget voor tokens. De training bestond uit twee fasen: eerst leren om ruizige tekstblokken te reconstrueren, daarna een gecombineerde fase van versterkend leren en sampler-destillatie, die Google SD·RL noemt. Het rapport stelt dat dit de redeneerbenchmarks gemiddeld met tien punten verbetert terwijl het aantal tokens per stap bijna verviervoudigt, en dat antwoorden ongeveer 50% korter zijn. Door de bidirectionele verwerking van DiffusionGemma kan het zichzelf corrigeren voordat het output produceert, waardoor het na fine-tuning met 85% nauwkeurigheid Sudoku-puzzels kan oplossen, terwijl het basismodel faalt. Het behoudt ook de mogelijkheid om woord voor woord te genereren, zodat gebruikers kunnen schakelen tussen modi. De absolute prestaties liggen echter onder die van het autoregressieve model, onder andere door de omzetting achteraf en een korte trainingsfase gericht op snelheid. Het model vervalt soms in herhalingslussen en kan er niet in slagen om redeneersecties af te sluiten, wat de benchmarkscores verlaagt. Het snelheidsvoordeel geldt vooral in scenario's met één gebruiker, omdat autoregressieve modellen bij meer dan 32 gelijktijdige verzoeken de doorvoer inhalen. Google positioneert DiffusionGemma als experimenteel, met als doel onderzoek te versnellen en een basis te bieden voor gespecialiseerde aanpassingen. Het wordt al gebruikt door startup Interfaze voor meertalige spraakherkenning en in een project voor interactieve radiologieverslagen. Het model is beschikbaar onder Apache 2.0 op Hugging Face, en een voorloper, Gemini Diffusion, werd in mei 2025 gedemonstreerd.
Bron: The Decoder (DE) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws