ModelosCódigo Abierto 🇺🇸 27.07.2026 12:02

DiffusionGemma: acelerando la generación de texto hasta 4 veces

Google/DeepMindGoogle/DeepMind DeepMindDeepMind NVIDIANVIDIA
Google DeepMind ha presentado DiffusionGemma, un modelo abierto experimental basado en difusión de texto. El modelo genera bloques completos de texto simultáneamente, logrando una aceleración de hasta 4 veces en comparación con los modelos de lenguaje grandes autorregresivos, y está diseñado para investigadores y desarrolladores que trabajan en escenarios locales y de latencia crítica.
Google DeepMind ha anunciado DiffusionGemma, un modelo experimental de código abierto (licencia Apache 2.0) que utiliza difusión de texto para generar contenido. A diferencia de los modelos de lenguaje grandes (LLM, por sus siglas en inglés) autorregresivos tradicionales, que procesan tokens de forma secuencial, DiffusionGemma genera bloques de texto simultáneamente, logrando una aceleración de hasta 4 veces en GPU (más de 1000 tokens por segundo en una sola NVIDIA H100, y más de 700 tokens por segundo en una NVIDIA GeForce RTX 5090). El modelo tiene una arquitectura de mezcla de expertos (Mixture of Experts, MoE) con 26 mil millones de parámetros, pero solo activa 3,8 mil millones durante la inferencia, lo que permite que quepa en 18 GB de memoria de video con cuantización. Las características clave incluyen atención bidireccional (256 tokens por pasada), autocorrección iterativa y un enfoque en tareas no lineales como edición de código, completado de espacios en blanco o trabajo con secuencias de aminoácidos. Sin embargo, la calidad de las salidas es inferior a la de la Gemma 4 estándar; se recomienda a los desarrolladores que necesiten máxima precisión usar la versión autorregresiva. DiffusionGemma es especialmente eficiente para inferencia local con baja concurrencia; en la nube con alto rendimiento, la ganancia se reduce. El modelo ya está disponible para descargar en Hugging Face, con soporte en MLX, vLLM y Hugging Face Transformers; se planea integración con llama.cpp. DeepMind colaboró con NVIDIA para optimizarlo en GPU de consumo y empresariales (GeForce RTX 5090/4090, Hopper, Blackwell, NVIDIA DGX Spark, DGX Station, RTX PRO); se admite el formato de 4 bits NVFP4 para aceleración. También se han publicado una guía para desarrolladores, un recurso visual y un tutorial de ajuste fino usando Hackable Diffusion (JAX).
Fuente: Google DeepMind — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas