Ускорение моделей Gemini Nano на Pixel с помощью замороженного многотокенного прогнозирования
Google/DeepMind
Google DeepMind
Google объявила о внедрении метода многотокенного прогнозирования (MTP) в замороженные модели Gemini Nano v3 на устройствах Pixel 9 и 10, что ускоряет генерацию текста более чем на 50% и снижает энергопотребление. MTP использует легковесную голову трансформера, прикрепляемую к последним слоям основной модели, что позволяет избежать дублирования памяти и обеспечивает сохранение исходного качества.
Исследователи Google представили метод модернизации многотокенного прогнозирования (MTP) для замороженных развернутых моделей, ускоряющий инференс на устройствах без необходимости использования отдельных моделей-черновиков. В отличие от традиционного спекулятивного декодирования, где требуется отдельная небольшая модель, MTP добавляет легковесную голову трансформера к последним слоям основной
Показать ещё ↓
- Сокращения
- LLM = Large Language Model — большая языковая модель
- RAM = Random Access Memory — оперативная память
- MTP = Multi-Token Prediction — многотокенное прогнозирование
- KV = Key-Value — ключ-значение
Источник: Google Research —
оригинал
