RechercheMatériel et Inférence 🇺🇸 27.07.2026 05:05

Accélérer les modèles Gemini Nano sur Pixel avec la prédiction multi-token gelée

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google a annoncé la mise en œuvre de la prédiction multi-token sur les modèles gelés Gemini Nano v3 sur les appareils Pixel 9 et 10, accélérant la génération de texte de plus de 50 % et réduisant la consommation d'énergie. La MTP utilise une tête de transformateur légère attachée aux dernières couches du modèle de base, évitant la duplication de mémoire et préservant la qualité originale.
Des chercheurs de Google ont présenté une méthode de modernisation du décodage multi-tokens (MTP) pour les modèles déployés figés, accélérant l'inférence sur les appareils sans nécessiter de modèles brouillons séparés. Contrairement au décodage spéculatif traditionnel, qui requiert un petit modèle distinct, le MTP ajoute une tête de transformeur légère aux dernières couches du modèle principal Gemini Nano v3, en utilisant les états cachés déjà calculés par le modèle principal et le cache clé-valeur (cache KV). Cela évite le double usage de mémoire et le pré-traitement du prompt. Le MTP est compatible avec les poids figés du modèle principal, garantissant l'identité des sorties et la préservation de la sécurité. Sur les appareils Pixel 9 et 10, la méthode offre une accélération de plus de 50 % pour des tâches telles que le résumé de notifications et la vérification de texte. En moyenne, le MTP prédit correctement près de deux tokens supplémentaires par passage d'inférence, réduisant ainsi le nombre d'étapes de vérification et la consommation d'énergie.
Source: Google Research — original
Nos articles précédents sur ce sujet ↓
Infos fraîches