ResearchHardware & Inference 🇺🇸 27.07.2026 05:05

Accelerating Gemini Nano Models on Pixel with Frozen Multi-Token Prediction

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google has announced the implementation of multi-token prediction on frozen Gemini Nano v3 models on Pixel 9 and 10 devices, accelerating text generation by over 50% and reducing energy consumption. MTP uses a lightweight transformer head attached to the final layers of the base model, avoiding memory duplication and preserving original quality.
Исследователи Google представили метод модернизации многотокенного прогнозирования (MTP) для замороженных развернутых моделей, ускоряющий инференс на устройствах без необходимости использования отдельных моделей-черновиков. В отличие от традиционного спекулятивного декодирования, где требуется отдельная небольшая модель, MTP добавляет легковесную голову трансформера к последним слоям основной модели Gemini Nano v3, которая использует уже вычисленные основной моделью скрытые состояния и кэш ключ-значение (KV-кэш). Это позволяет избежать двойного расхода памяти и предварительной обработки промпта. MTP совместима с замороженными весами основной модели, что гарантирует идентичность выходных данных и сохранение безопасности. На устройствах Pixel 9 и 10 метод обеспечивает ускорение более 50% для задач, таких как сводка уведомлений и проверка текста. В среднем MTP правильно предсказывает почти два дополнительных токена за проход инференса, что сокращает количество шагов верификации и снижает энергопотребление.
Source: Google Research — original
Our earlier posts on this topic ↓
Fresh news