Google DiffusionGemma : un rapport technique explique le modèle de diffusion de texte rapide
Google/DeepMind
NVIDIA
Google DeepMind a publié un rapport technique sur DiffusionGemma, un modèle de diffusion de texte qui génère 256 jetons en parallèle, atteignant environ 1 500 jetons par seconde sur un Nvidia H100. Le modèle a été créé en convertissant le modèle Gemma 4 existant en un modèle de diffusion avec moins de 10 % du budget de jetons d'entraînement d'origine. Le rapport met en évidence à la fois les points forts du modèle, comme l'auto-correction, et ses limites en matière de raisonnement et de débit multi-utilisateurs.
Google DeepMind a publié un rapport technique sur DiffusionGemma, un modèle sorti à la mi-juin qui génère du texte en affinant des blocs de 256 jetons en parallèle, à l'instar de la génération d'images à partir de bruit. Sur l'accélérateur H100 de Nvidia, il atteint environ 1 500 jetons par seconde. Au lieu d'un entraînement de zéro, le modèle existant Gemma-4-26B-A4B a été converti en modèle de diffusion en utilisant moins de 10 % du budget de jetons d'entraînement d'origine. L'entraînement a comporté deux étapes : d'abord, l'apprentissage à reconstruire des blocs de texte bruités, puis une phase combinée d'apprentissage par renforcement et de distillation de l'échantillonneur, que Google appelle SD·RL. Le rapport indique que cela améliore les benchmarks de raisonnement en moyenne de dix points tout en quadruplant presque les jetons par étape, et que les réponses sont environ 50 % plus courtes. Le traitement bidirectionnel de DiffusionGemma permet l'auto-correction avant la sortie, ce qui lui permet de résoudre des grilles de Sudoku avec 85 % de précision après un réglage fin, alors que le modèle de base échoue. Il conserve également la capacité de générer mot à mot, permettant aux utilisateurs de changer de mode. Cependant, la performance absolue est inférieure à celle du modèle autorégressif en raison de facteurs tels que la conversion a posteriori et une phase d'entraînement courte visant la vitesse. Le modèle tombe parfois dans des boucles de répétition et peut ne pas fermer les sections de raisonnement, ce qui réduit les scores des benchmarks. L'avantage de vitesse s'applique principalement dans les scénarios à utilisateur unique, car les modèles autorégressifs rattrapent le débit au-delà de 32 requêtes concurrentes. Google positionne DiffusionGemma comme expérimental, visant à accélérer la recherche et à fournir une base pour des adaptations spécialisées. Il est déjà utilisé par la startup Interfaze pour la reconnaissance vocale multilingue et dans un projet de comptes rendus radiologiques interactifs. Le modèle est disponible sous licence Apache 2.0 sur Hugging Face, et un précurseur, Gemini Diffusion, a été démontré en mai 2025.
Source: The Decoder (DE) —
original
