Matériel et InférenceModèles 🇺🇸 27.07.2026 05:05

Google accélère les modèles Gemini Nano sur Pixel avec la prédiction multi-tokens gelée

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google a introduit une méthode pour ajouter la prédiction multi-tokens (MTP) aux modèles de production gelés comme Gemini Nano v3, permettant une inférence plus rapide sur les appareils Pixel 9 et 10. La tête MTP se fixe aux couches finales du modèle principal, exploitant ses états cachés et son cache KV pour générer plusieurs tokens par passage d'inférence sans modèles de rédaction séparés, obtenant des accélérations de 50% ou plus et réduisant la consommation mémoire de 130 Mo par instance.
Google Research a annoncé une nouvelle architecture pour accélérer les modèles de langage embarqués, tels que Gemini Nano v3, sur les smartphones Pixel. L'approche consiste à adapter la prédiction multi-tokens (Multi-Token Prediction, MTP) à des modèles de base gelés en ajoutant une tête Transformer légère aux couches finales. Cette tête MTP utilise directement le cache clé-valeur existant du modèle principal via une attention croisée, éliminant ainsi le besoin d'un modèle rédacteur indépendant et réduisant la surcharge mémoire de 130 Mo par instance. Dans des tâches de production comme les résumés de notifications par intelligence artificielle (AI Notification Summaries) et la relecture (Proofread), la MTP produit près de deux tokens supplémentaires par passage d'inférence, ce qui améliore la vitesse de plus de 50 % sur les appareils Pixel 9. Le résultat final est identique au niveau du bit à celui du modèle de base, garantissant l'alignement de la sécurité et la compatibilité ascendante. Cette méthode a été déployée sur les séries Pixel 9 et Pixel 10, et Google prévoit d'explorer le décodage parallèle et la tolérance de vérification pour gagner en efficacité.
Source: Google Research — original
Nos articles précédents sur ce sujet ↓
Infos fraîches