Google ускоряет модели Gemini Nano на Pixel с помощью замороженного множественного предсказания токенов

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google представил метод адаптации множественного предсказания токенов (MTP) к замороженным производственным моделям, таким как Gemini Nano v3, что позволяет ускорить локальный вывод на устройствах Pixel 9 и 10. Головка MTP подключается к конечным слоям основной модели, используя её скрытые состояния и KV-кэш для генерации нескольких токенов за один проход вывода без отдельных черновых моделей, достигая ускорения на 50% и более, а также снижая потребление памяти на 130 МБ на экземпляр.
Google Research объявила о новой архитектуре для ускорения работы языковых моделей на устройствах, таких как Gemini Nano v3 на смартфонах Pixel. Подход модернизирует механизм мультитокенового предсказания (multi-token prediction, MTP), добавляя лёгкий Transformer-блок к финальным слоям замороженной базовой модели. Этот MTP-блок напрямую использует существующий кэш ключей-значений основной модели
Показать ещё ↓
Источник: Google Research — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости