ModellenOpen Source 🇺🇸 27.07.2026 12:02

DiffusionGemma: 4x snellere tekstgeneratie

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind heeft DiffusionGemma geïntroduceerd, een experimenteel open 26B Mixture of Experts-model dat tekstdiffusie gebruikt om tot 4x sneller te genereren dan autoregressieve LLM's op GPU's. Het verwerkt tegelijkertijd blokken van 256 tokens en richt zich op snelheidskritische lokale workflows zoals inline-bewerking. Het model is uitgebracht onder de Apache 2.0-licentie op Hugging Face.
Google DeepMind heeft DiffusionGemma uitgebracht, een experimenteel 26B-parameters Mixture of Experts (MoE)-model onder de Apache 2.0-licentie, dat tot 4x snellere tekstgeneratie mogelijk maakt door een diffusiegebaseerde aanpak te gebruiken in plaats van sequentiële tokenvoorspelling. Het model activeert slechts 3,8B parameters per inferentie, past binnen 18 GB VRAM bij kwantisering en behaalt meer dan 1000 tokens per seconde op NVIDIA H100 en 700+ op GeForce RTX 5090. Het gebruikt bidirectionele aandacht om 256 tokens parallel te genereren, wat niet-lineaire taken mogelijk maakt zoals het invullen van code en het oplossen van Sudoku. DiffusionGemma is geoptimaliseerd voor lokale inferentie met lage gelijktijdigheid, waarbij de parallelle decodering het grootste voordeel biedt, terwijl autoregressieve modellen beter blijven voor cloudservers met hoge QPS (queries per seconde). Het model verfijnt zijn uitvoer iteratief en kan worden gefinetuned met tools zoals Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo, met ondersteuning voor llama.cpp in de maak. Google DeepMind werkte samen met NVIDIA voor hardwareoptimalisaties, waaronder NVFP4-kernels, en het model is beschikbaar op Hugging Face, Gemini Enterprise Agent Platform en NVIDIA NIM.
Bron: Google DeepMind — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws