Ускорение моделей Gemini Nano на Pixel с помощью замороженного многотокенного прогнозирования

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google объявила о внедрении метода многотокенного прогнозирования (MTP) в замороженные модели Gemini Nano v3 на устройствах Pixel 9 и 10, что ускоряет генерацию текста более чем на 50% и снижает энергопотребление. MTP использует легковесную голову трансформера, прикрепляемую к последним слоям основной модели, что позволяет избежать дублирования памяти и обеспечивает сохранение исходного качества.
Исследователи Google представили метод модернизации многотокенного прогнозирования (MTP) для замороженных развернутых моделей, ускоряющий инференс на устройствах без необходимости использования отдельных моделей-черновиков. В отличие от традиционного спекулятивного декодирования, где требуется отдельная небольшая модель, MTP добавляет легковесную голову трансформера к последним слоям основной
Показать ещё ↓
Сокращения
LLM = Large Language Model — большая языковая модель
RAM = Random Access Memory — оперативная память
MTP = Multi-Token Prediction — многотокенное прогнозирование
KV = Key-Value — ключ-значение
Источник: Google Research — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости