Hardware e InferenciaModelos 🇺🇸 27.07.2026 05:05

Google acelera los modelos Gemini Nano en Pixel con predicción congelada de múltiples tokens

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google ha presentado un método para adaptar la Predicción de Múltiples Tokens (MTP, por sus siglas en inglés) a modelos de producción congelados como Gemini Nano v3, lo que permite una inferencia en el dispositivo más rápida en los dispositivos Pixel 9 y 10. El cabezal MTP se conecta a las últimas capas del modelo principal, aprovechando sus estados ocultos y caché KV para generar múltiples tokens por paso de inferencia sin necesidad de modelos de drafting separados, logrando aceleraciones del 50 por ciento o más y reduciendo el consumo de memoria en 130 MB por instancia.
Google Research ha anunciado una nueva arquitectura para acelerar modelos de lenguaje en el dispositivo, como Gemini Nano v3 en los smartphones Pixel. El enfoque adapta la predicción de múltiples tokens (MTP, por sus siglas en inglés) a modelos base congelados, añadiendo una cabeza Transformer ligera a las capas finales. Esta cabeza MTP utiliza directamente el caché clave-valor existente del modelo principal mediante atención cruzada, eliminando la necesidad de un modelo borrador independiente y reduciendo la sobrecarga de memoria en 130 MB por instancia. En tareas de producción como Resúmenes de Notificaciones con IA y Revisión, MTP produce casi dos tokens adicionales por pasada de inferencia, lo que genera mejoras de velocidad de más del 50% en dispositivos Pixel 9. El resultado final es bit-idéntico al del modelo base, lo que garantiza la alineación de seguridad y la compatibilidad retrospectiva. El método se ha implementado en las series Pixel 9 y 10, y Google planea explorar la decodificación paralela y la flexibilidad de verificación para obtener mayores ganancias de eficiencia.
Fuente: Google Research — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas