DiffusionGemma: Tekstgeneratie tot 4 keer sneller
Google/DeepMind
DeepMind
NVIDIA
Google DeepMind heeft DiffusionGemma geïntroduceerd, een experimenteel open model gebaseerd op tekstdiffusie. Het model genereert tegelijkertijd hele tekstblokken, wat een snelheidsverhoging tot 4 keer oplevert in vergelijking met autoregressieve grote taalmodellen. Het is ontworpen voor onderzoekers en ontwikkelaars die werken met lokale, latentiekritische scenario's.
Google DeepMind heeft DiffusionGemma aangekondigd, een experimenteel model met open source (licentie Apache 2.0) dat tekst-diffusie gebruikt voor generatie. In tegenstelling tot traditionele autoregressieve Large Language Models (LLM's), die tokens sequentieel verwerken, genereert DiffusionGemma tekstblokken tegelijkertijd, wat leidt tot een versnelling tot 4 keer op een Graphics Processing Unit (GPU) (meer dan 1000 tokens per seconde op een enkele NVIDIA H100, meer dan 700 tokens per seconde op een NVIDIA GeForce RTX 5090). Het model heeft een Mixture of Experts (MoE)-architectuur met 26 miljard parameters, maar activeert slechts 3,8 miljard bij inferentie, waardoor het past in 18 GB videogeheugen na kwantisatie. Belangrijke kenmerken: bidirectionele aandacht (256 tokens per doorgang), iteratieve zelfcorrectie en focus op niet-lineaire taken zoals code bewerken, gaten opvullen of werken met aminozuursequenties. De kwaliteit van de uitvoer is echter lager dan die van de standaard Gemma 4; ontwikkelaars die maximale nauwkeurigheid nodig hebben, wordt aangeraden de autoregressieve versie te gebruiken. DiffusionGemma is vooral effectief bij lokale inferentie met lage concurrency; in de cloud met hoge doorvoer is de winst kleiner. Het model is al beschikbaar om te downloaden op Hugging Face, wordt ondersteund in MLX, vLLM, Hugging Face Transformers; integratie met llama.cpp is gepland. DeepMind werkte samen met NVIDIA voor optimalisatie op consumenten- en bedrijfs-GPU's (GeForce RTX 5090/4090, Hopper, Blackwell, NVIDIA DGX Spark, DGX Station, RTX PRO); het 4-bits NVFP4-formaat wordt ondersteund voor versnelling. Ook zijn er een ontwikkelaarsgids, een visuele handleiding en een tutorial voor finetuning met behulp van Hackable Diffusion (JAX) gepubliceerd.
Bron: Google DeepMind —
origineel
