ModelosInvestigación 🇩🇪 09.08.2026 13:01

Google DiffusionGemma: el informe técnico explica el modelo rápido de difusión de texto

Google/DeepMindGoogle/DeepMind NVIDIANVIDIA
Google DeepMind ha publicado un informe técnico sobre DiffusionGemma, un modelo de difusión de texto que genera 256 tokens en paralelo, alcanzando alrededor de 1.500 tokens por segundo en una Nvidia H100. El modelo se creó convirtiendo el modelo Gemma 4 existente en un modelo de difusión con menos del 10% del presupuesto original de tokens de entrenamiento. El informe destaca tanto las fortalezas del modelo, como la autocorrección, como sus limitaciones en razonamiento y rendimiento multiusuario.
Google DeepMind ha publicado un informe técnico sobre DiffusionGemma, un modelo lanzado a mediados de junio que genera texto refinando bloques de 256 tokens en paralelo, de manera similar a la generación de imágenes a partir de ruido. En el acelerador H100 de Nvidia, alcanza aproximadamente 1.500 tokens por segundo. En lugar de entrenarse desde cero, el modelo existente Gemma-4-26B-A4B se convirtió en un modelo de difusión utilizando menos del 10% del presupuesto de tokens de entrenamiento original. El entrenamiento implicó dos etapas: primero, aprender a reconstruir bloques de texto ruidosos, y luego una fase combinada de aprendizaje por refuerzo y destilación del muestreador, que Google denomina SD·RL. El informe afirma que esto mejora los puntos de referencia de razonamiento en un promedio de diez puntos, mientras que casi cuadruplica los tokens por paso, y las respuestas son aproximadamente un 50% más cortas. El procesamiento bidireccional de DiffusionGemma permite la autocorrección antes de la salida, lo que le permite resolver rompecabezas de Sudoku con una precisión del 85% después del ajuste fino, mientras que el modelo base falla. También conserva la capacidad de generar palabra por palabra, lo que permite a los usuarios cambiar de modo. Sin embargo, el rendimiento absoluto está por debajo del modelo autorregresivo debido a factores como la conversión posterior al entrenamiento y una fase de entrenamiento corta destinada a la velocidad. El modelo ocasionalmente cae en bucles de repetición y puede no cerrar las secciones de razonamiento, lo que reduce las puntuaciones de los puntos de referencia. La ventaja de velocidad se aplica principalmente en escenarios de usuario único, ya que los modelos autorregresivos alcanzan la misma productividad más allá de 32 solicitudes concurrentes. Google posiciona a DiffusionGemma como experimental, con el objetivo de acelerar la investigación y proporcionar una base para adaptaciones especializadas. Ya es utilizado por la startup Interfaze para el reconocimiento de voz multilingüe y en un proyecto de informes de radiología interactivos. El modelo está disponible bajo Apache 2.0 en Hugging Face, y un precursor, Gemini Diffusion, se demostró en mayo de 2025.
Fuente: The Decoder (DE) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas