DiffusionGemma: генерация текста в 4 раза быстрее
Google/DeepMind
DeepMind
NVIDIA
Компания Google DeepMind представила DiffusionGemma — экспериментальную открытую модель смеси экспертов (Mixture of Experts) на 26 миллиардов параметров, которая использует текстовую диффузию для генерации до 4 раз быстрее, чем авторегрессионные большие языковые модели (LLM) на графических процессорах (GPU). Она одновременно обрабатывает блоки по 256 токенов, ориентируясь на критичные по скорости локальные рабочие процессы, такие как встроенное редактирование, и опубликована под лицензией Apache 2.0 на платформе Hugging Face.
Google DeepMind выпустила DiffusionGemma — экспериментальную модель Mixture of Experts (MoE) с 26 миллиардами параметров, распространяемую под лицензией Apache 2.0. Модель обеспечивает до 4-кратного ускорения генерации текста за счет использования диффузионного подхода вместо последовательного предсказания токенов. При каждом выводе активируется лишь 3,8 миллиарда параметров, что позволяет
Показать ещё ↓
Источник: Google DeepMind —
оригинал
