InvestigaciónHardware e Inferencia 🇺🇸 27.07.2026 05:05

Acelerando Modelos Gemini Nano en Pixel con Predicción Congelada de Múltiples Tokens

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google ha anunciado la implementación de la predicción de múltiples tokens (MTP) en modelos congelados Gemini Nano v3 en dispositivos Pixel 9 y 10, acelerando la generación de texto en más de un 50% y reduciendo el consumo energético. MTP utiliza una cabeza de transformer ligera acoplada a las capas finales del modelo base, evitando la duplicación de memoria y preservando la calidad original.
Los investigadores de Google presentaron un método para modernizar la predicción de múltiples tokens (MTP, por sus siglas en inglés) para modelos congelados ya implementados, acelerando la inferencia en dispositivos sin necesidad de usar modelos auxiliares separados. A diferencia del descodificación especulativa tradicional, que requiere un modelo pequeño independiente, MTP añade una cabeza ligera de transformador a las últimas capas del modelo principal Gemini Nano v3, que utiliza los estados ocultos ya calculados por el modelo principal y la caché de clave-valor (caché KV). Esto evita el doble gasto de memoria y el preprocesamiento del prompt. MTP es compatible con los pesos congelados del modelo principal, lo que garantiza la identidad de las salidas y mantiene la seguridad. En los dispositivos Pixel 9 y 10, el método logra una aceleración de más del 50% para tareas como el resumen de notificaciones y la revisión de texto. En promedio, MTP predice correctamente casi dos tokens adicionales por paso de inferencia, lo que reduce el número de pasos de verificación y disminuye el consumo de energía.
Fuente: Google Research — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas