ModelosPesquisa 🇩🇪 09.08.2026 13:01

Google DiffusionGemma: Relatório técnico explica o modelo de difusão de texto rápido

Google/DeepMindGoogle/DeepMind NVIDIANVIDIA
O Google DeepMind publicou um relatório técnico sobre o DiffusionGemma, um modelo de difusão de texto que gera 256 tokens em paralelo, atingindo cerca de 1.500 tokens por segundo em um Nvidia H100. O modelo foi criado convertendo o modelo Gemma 4 existente em um modelo de difusão com menos de 10% do orçamento original de tokens de treinamento. O relatório destaca tanto os pontos fortes do modelo, como a autocorreção, quanto suas limitações em raciocínio e throughput multi-usuário.
O Google DeepMind publicou um relatório técnico sobre o DiffusionGemma, um modelo lançado em meados de junho que gera texto refinando blocos de 256 tokens em paralelo, de forma semelhante à geração de imagens a partir de ruído. Na aceleradora H100 da Nvidia, ele atinge cerca de 1.500 tokens por segundo. Em vez de treinar do zero, o modelo existente Gemma-4-26B-A4B foi convertido em um modelo de difusão usando menos de 10% do orçamento original de tokens de treinamento. O treinamento envolveu duas etapas: primeiro, aprender a reconstruir blocos de texto ruidosos; depois, uma fase combinada de aprendizado por reforço e destilação do amostrador, que o Google chama de SD·RL. O relatório afirma que isso melhora os benchmarks de raciocínio em média dez pontos, enquanto quase quadruplica os tokens por etapa, e as respostas são cerca de 50% mais curtas. O processamento bidirecional do DiffusionGemma permite autocorreção antes da saída, permitindo que ele resolva quebra-cabeças de Sudoku com 85% de precisão após ajuste fino, enquanto o modelo base falha. Ele também mantém a capacidade de gerar palavra por palavra, permitindo que os usuários alternem modos. No entanto, o desempenho absoluto é inferior ao modelo autorregressivo, devido a fatores como a conversão posterior e uma fase de treinamento curta voltada para a velocidade. O modelo ocasionalmente entra em loops de repetição e pode falhar ao encerrar seções de raciocínio, reduzindo as pontuações dos benchmarks. A vantagem de velocidade se aplica principalmente a cenários de usuário único, pois modelos autorregressivos alcançam o mesmo rendimento em mais de 32 solicitações concorrentes. O Google posiciona o DiffusionGemma como experimental, com o objetivo de acelerar a pesquisa e fornecer uma base para adaptações especializadas. Ele já é usado pela startup Interfaze para reconhecimento de fala multilíngue e em um projeto de laudos radiológicos interativos. O modelo está disponível sob a licença Apache 2.0 no Hugging Face, e um precursor, o Gemini Diffusion, foi demonstrado em maio de 2025.
Fonte: The Decoder (DE) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas