Google DiffusionGemma: технический отчет объясняет быструю текстовую диффузионную модель
Google DeepMind опубликовала технический отчет о DiffusionGemma, текстовой диффузионной модели, которая генерирует 256 токенов параллельно, достигая скорости около 1500 токенов в секунду на Nvidia H100. Модель была создана путем преобразования существующей модели Gemma 4 в диффузионную модель с бюджетом обучения, составляющим менее 10% от исходного. В отчете подчеркиваются как сильные стороны модели, такие как самокоррекция, так и ее ограничения в рассуждениях и многопользовательской пропускной способности.
Google DeepMind опубликовала технический отчет о модели DiffusionGemma, выпущенной в середине июня, которая генерирует текст, уточняя блоки из 256 токенов параллельно, подобно генерации изображений из шума. На ускорителе Nvidia H100 она достигает примерно 1500 токенов в секунду. Вместо обучения с нуля существующая модель Gemma-4-26B-A4B была преобразована в диффузионную модель с использованием
Показать ещё ↓
Источник: The Decoder (DE) —
оригинал
