МоделиOpen Source 🇺🇸 27.07.2026 12:02

DiffusionGemma: ускорение генерации текста до 4 раз

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind представила DiffusionGemma — экспериментальную открытую модель, основанную на диффузии текста. Модель генерирует целые блоки текста одновременно, обеспечивая до 4-кратного ускорения по сравнению с авторегрессионными LLM, и предназначена для исследователей и разработчиков, работающих с локальными сценариями, критичными к скорости.
Google DeepMind анонсировал DiffusionGemma — экспериментальную модель с открытым исходным кодом (лицензия Apache 2.0), использующую диффузию текста для генерации. В отличие от традиционных авторегрессионных LLM, которые обрабатывают токены последовательно, DiffusionGemma генерирует блоки текста одновременно, достигая ускорения до 4 раз на GPU (более 1000 токенов в секунду на одном NVIDIA H100,
Показать ещё ↓
Сокращения
MoE = Mixture of Experts — смесь экспертов
LLM = Large Language Model — большая языковая модель
GPU = Graphics Processing Unit — графический процессор
TPU = Tensor Processing Unit — тензорный процессор
VRAM = Video Random Access Memory — видеопамять
SVG = Scalable Vector Graphics — масштабируемая векторная графика
QPS = Queries Per Second — запросов в секунду
NVFP4 = NVIDIA Floating Point 4-bit — 4-битный формат с плавающей запятой NVIDIA
Источник: Google DeepMind — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости