ModelosCódigo Abierto 🇺🇸 27.07.2026 12:02

DiffusionGemma: generación de texto 4 veces más rápida

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind ha presentado DiffusionGemma, un modelo experimental abierto de 26B de mezcla de expertos que utiliza difusión de texto para generar hasta 4 veces más rápido que los modelos de lenguaje grandes autorregresivos en GPUs. Procesa simultáneamente bloques de 256 tokens, dirigido a flujos de trabajo locales donde la velocidad es crítica, como la edición en línea, y se publica bajo Apache 2.0 en Hugging Face.
Google DeepMind ha lanzado DiffusionGemma, un modelo experimental de 26 mil millones de parámetros basado en la arquitectura de Mezcla de Expertos (MoE, por sus siglas en inglés) bajo la licencia Apache 2.0, que logra una generación de texto hasta cuatro veces más rápida mediante un enfoque basado en difusión en lugar de la predicción secuencial de tokens. El modelo activa solo 3.8 mil millones de parámetros por inferencia, ocupando menos de 18 GB de VRAM cuando se cuantiza, y alcanza más de 1000 tokens por segundo en NVIDIA H100 y más de 700 en GeForce RTX 5090. Utiliza atención bidireccional para generar 256 tokens en paralelo, lo que permite tareas no lineales como completar código o resolver Sudokus. DiffusionGemma está optimizado para inferencia local con baja concurrencia, donde su decodificación paralela ofrece el máximo beneficio, mientras que los modelos autorregresivos siguen siendo mejores para servidores en la nube con alto QPS (consultas por segundo). El modelo refina su salida de forma iterativa y se puede ajustar con herramientas como Unsloth, Hugging Face, vLLM, MLX, JAX, NVIDIA NeMo, con soporte próximo para llama.cpp. Google DeepMind colaboró con NVIDIA para optimizaciones de hardware que incluyen kernels NVFP4, y el modelo está disponible en Hugging Face, Gemini Enterprise Agent Platform y NVIDIA NIM.
Fuente: Google DeepMind — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas