DiffusionGemma : génération de texte 4 fois plus rapide
Google/DeepMind
DeepMind
NVIDIA
Google DeepMind a dévoilé DiffusionGemma, un modèle expérimental open source de 26 milliards de paramètres à mélange d'experts, qui utilise la diffusion de texte pour générer du contenu jusqu'à 4 fois plus rapidement que les grands modèles de langage autorégressifs sur GPU. Il traite simultanément des blocs de 256 jetons, ce qui le rend adapté aux workflows locaux critiques en termes de vitesse, comme l'édition en ligne, et est publié sous licence Apache 2.0 sur Hugging Face.
Google DeepMind a publié DiffusionGemma, un modèle expérimental de mélange d'experts (MoE) de 26 milliards de paramètres sous licence Apache 2.0, qui permet une génération de texte jusqu'à quatre fois plus rapide grâce à une approche basée sur la diffusion plutôt que sur la prédiction séquentielle de tokens. Le modèle n'active que 3,8 milliards de paramètres par inférence, ce qui lui permet de tenir dans 18 Go de mémoire vidéo une fois quantifié, et atteint plus de 1000 tokens par seconde sur NVIDIA H100 et 700+ sur GeForce RTX 5090. Il utilise une attention bidirectionnelle pour générer 256 tokens en parallèle, permettant des tâches non linéaires comme le remplissage de code et la résolution de Sudoku. DiffusionGemma est optimisé pour l'inférence locale à faible concurrence, où son décodage parallèle offre un maximum d'avantages, tandis que les modèles autorégressifs restent plus adaptés au déploiement cloud à haut débit de requêtes. Le modèle affine itérativement ses sorties et peut être affiné à l'aide d'outils tels que Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo, avec un support à venir pour llama.cpp. Google DeepMind a collaboré avec NVIDIA pour des optimisations matérielles, notamment les kernels NVFP4, et le modèle est disponible sur Hugging Face, la plateforme Gemini Enterprise Agent ainsi que NVIDIA NIM.
Source: Google DeepMind —
original
