DiffusionGemma: Acelerando a Geração de Texto em Até 4 Vezes
Google/DeepMind
DeepMind
NVIDIA
O Google DeepMind apresentou o DiffusionGemma, um modelo experimental aberto baseado em difusão de texto. O modelo gera blocos inteiros de texto simultaneamente, alcançando uma aceleração de até 4 vezes em comparação com grandes modelos de linguagem autorregressivos, e foi projetado para pesquisadores e desenvolvedores que trabalham com cenários locais e de latência crítica.
Google DeepMind anunciou o DiffusionGemma — um modelo experimental de código aberto (licença Apache 2.0) que utiliza difusão de texto para geração. Diferentemente dos modelos de linguagem grandes (large language models, LLMs) autorregressivos tradicionais, que processam tokens sequencialmente, o DiffusionGemma gera blocos de texto simultaneamente, alcançando aceleração de até 4 vezes em GPUs (mais de 1000 tokens por segundo em uma única NVIDIA H100, mais de 700 tokens por segundo em uma NVIDIA GeForce RTX 5090). O modelo possui arquitetura de mistura de especialistas (Mixture of Experts, MoE) com 26 bilhões de parâmetros, mas ativa apenas 3,8 bilhões durante a inferência, permitindo caber em 18 GB de memória de vídeo com quantização. Principais características: atenção bidirecional (256 tokens por passada), autocorreção iterativa e foco em tarefas não lineares, como edição de código, preenchimento de lacunas ou trabalho com sequências de aminoácidos. No entanto, a qualidade da saída é inferior à da Gemma 4 padrão; desenvolvedores que priorizam máxima precisão são aconselhados a usar a versão autorregressiva. O DiffusionGemma é especialmente eficaz em inferência local com baixa contenção; na nuvem com alta taxa de transferência, o ganho é reduzido. O modelo já está disponível para download no Hugging Face, com suporte em MLX, vLLM, Hugging Face Transformers; planeja-se integração com llama.cpp. A DeepMind colaborou com a NVIDIA para otimização em GPUs de consumo e corporativas (GeForce RTX 5090/4090, Hopper, Blackwell, NVIDIA DGX Spark, DGX Station, RTX PRO); há suporte ao formato de 4 bits NVFP4 para aceleração. Também foram publicados um guia do desenvolvedor, um material visual e um tutorial de ajuste fino usando Hackable Diffusion (JAX).
Fonte: Google DeepMind —
original
