DiffusionGemma: ускорение генерации текста до 4 раз
Google/DeepMind
DeepMind
NVIDIA
Google DeepMind представила DiffusionGemma — экспериментальную открытую модель, основанную на диффузии текста. Модель генерирует целые блоки текста одновременно, обеспечивая до 4-кратного ускорения по сравнению с авторегрессионными LLM, и предназначена для исследователей и разработчиков, работающих с локальными сценариями, критичными к скорости.
Google DeepMind анонсировал DiffusionGemma — экспериментальную модель с открытым исходным кодом (лицензия Apache 2.0), использующую диффузию текста для генерации. В отличие от традиционных авторегрессионных LLM, которые обрабатывают токены последовательно, DiffusionGemma генерирует блоки текста одновременно, достигая ускорения до 4 раз на GPU (более 1000 токенов в секунду на одном NVIDIA H100,
Показать ещё ↓
- Сокращения
- MoE = Mixture of Experts — смесь экспертов
- LLM = Large Language Model — большая языковая модель
- GPU = Graphics Processing Unit — графический процессор
- TPU = Tensor Processing Unit — тензорный процессор
- VRAM = Video Random Access Memory — видеопамять
- SVG = Scalable Vector Graphics — масштабируемая векторная графика
- QPS = Queries Per Second — запросов в секунду
- NVFP4 = NVIDIA Floating Point 4-bit — 4-битный формат с плавающей запятой NVIDIA
Источник: Google DeepMind —
оригинал
