ModèlesOpen Source 🇺🇸 27.07.2026 12:02

DiffusionGemma : génération de texte jusqu'à 4 fois plus rapide

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind a présenté DiffusionGemma, un modèle ouvert expérimental basé sur la diffusion de texte. Ce modèle génère des blocs entiers de texte simultanément, offrant un gain de vitesse allant jusqu'à 4 fois par rapport aux grands modèles de langage autorégressifs, et est conçu pour les chercheurs et développeurs travaillant dans des scénarios locaux où la latence est critique.
Google DeepMind a annoncé DiffusionGemma, un modèle expérimental open source (licence Apache 2.0) utilisant la diffusion de texte pour la génération. Contrairement aux LLM autorégressifs classiques qui traitent les tokens séquentiellement, DiffusionGemma génère des blocs de texte simultanément, atteignant une accélération allant jusqu'à 4 fois sur GPU (plus de 1000 tokens par seconde sur un seul NVIDIA H100, plus de 700 tokens par seconde sur une NVIDIA GeForce RTX 5090). Le modèle repose sur une architecture de mélange d'experts (Mixture of Experts, MoE) avec 26 milliards de paramètres, mais n'en active que 3,8 milliards lors de l'inférence, ce qui lui permet de tenir dans 18 Go de mémoire vidéo avec quantification. Principales caractéristiques : attention bidirectionnelle (256 tokens par passage), auto-correction itérative et focalisation sur les tâches non linéaires telles que l'édition de code, le remplissage de blancs ou le travail avec des séquences d'acides aminés. Cependant, la qualité des sorties est inférieure à celle de la Gemma 4 standard ; les développeurs pour qui la précision maximale est cruciale sont invités à utiliser la version autorégressive. DiffusionGemma est particulièrement efficace pour l'inférence locale à faible concurrence ; dans le cloud avec un débit élevé, le gain se réduit. Le modèle est déjà disponible en téléchargement sur Hugging Face, pris en charge dans MLX, vLLM, Hugging Face Transformers ; l'intégration avec llama.cpp est prévue. DeepMind a collaboré avec NVIDIA pour l'optimisation sur les GPU grand public et professionnels (GeForce RTX 5090/4090, Hopper, Blackwell, NVIDIA DGX Spark, DGX Station, RTX PRO) ; le format 4 bits NVFP4 est pris en charge pour l'accélération. Sont également publiés un guide développeur, un aide-mémoire visuel et un tutoriel de fine-tuning utilisant Hackable Diffusion (JAX).
Source: Google DeepMind — original
Nos articles précédents sur ce sujet ↓
Infos fraîches