DiffusionGemma: geração de texto 4x mais rápida
Google/DeepMind
DeepMind
NVIDIA
O Google DeepMind apresentou o DiffusionGemma, um modelo experimental aberto de 26B Mixture of Experts que utiliza difusão de texto para gerar até 4x mais rápido do que LLMs autorregressivos em GPUs. Ele processa simultaneamente blocos de 256 tokens, visando fluxos de trabalho locais críticos de velocidade, como edição em linha, e foi lançado sob licença Apache 2.0 no Hugging Face.
O Google DeepMind lançou o DiffusionGemma, um modelo experimental de 26 bilhões de parâmetros do tipo Mistura de Especialistas (MoE) sob licença Apache 2.0, que alcança até 4 vezes mais velocidade na geração de texto ao usar uma abordagem baseada em difusão em vez da previsão sequencial de tokens. O modelo ativa apenas 3,8 bilhões de parâmetros por inferência, cabendo em 18 GB de VRAM quando quantizado, e atinge mais de 1000 tokens por segundo no NVIDIA H100 e mais de 700 no GeForce RTX 5090. Ele utiliza atenção bidirecional para gerar 256 tokens em paralelo, permitindo tarefas não lineares como preenchimento de código e resolução de Sudoku. O DiffusionGemma é otimizado para inferência local de baixa concorrência, onde sua decodificação paralela oferece o máximo benefício, enquanto modelos autorregressivos permanecem melhores para servidores em nuvem de alta QPS (consultas por segundo). O modelo refina iterativamente sua saída e pode ser afinado usando ferramentas como Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo, com suporte ao llama.cpp em breve. O Google DeepMind colaborou com a NVIDIA para otimizações de hardware, incluindo kernels NVFP4, e o modelo está disponível no Hugging Face, na Plataforma Gemini Enterprise Agent e no NVIDIA NIM.
Fonte: Google DeepMind —
original
