Investigación 🇷🇺 10.08.2026 14:03

Modelos de Lenguaje por Difusión: Cómo Funcionan, Qué Funciona y Qué Plantea Preguntas

СберСбер OpenAIOpenAI MicrosoftMicrosoft
Los modelos de lenguaje por difusión (dLLM, por sus siglas en inglés) generan texto en paralelo, rellenando máscaras en cualquier parte de la secuencia. Ofrecen ventajas como generación paralela, relleno de texto y robustez ante consultas inversas, pero enfrentan problemas como ineficiencia de memoria y generación de longitud fija. El artículo analiza investigaciones recientes, incluyendo LLaDA, Plaid y métodos de coincidencia de flujo, y explora la adaptación de modelos autorregresivos preentrenados.
Los modelos de lenguaje de difusión (dLLMs) generan texto en paralelo, rellenando máscaras en cualquier posición, a diferencia de los LLMs autorregresivos que generan token a token de izquierda a derecha. El enfoque de difusión enmascarada, relacionado con BERT, utiliza un proceso hacia adelante que reemplaza tokens con MASK y un proceso inverso que los restaura. Las ventajas incluyen generación en paralelo, relleno de texto, robustez a consultas inversas (como muestra LLaDA) y mejor rendimiento con datos limitados. Sin embargo, los dLLMs sufren de ineficiencia en la caché KV, suposición de tokens independientes y generación de longitud fija, lo que requiere trucos para longitud variable. La evaluación a menudo utiliza perplejidad (GenPPL) pero sufre de colapso por repetición; también se necesitan métricas de diversidad. La adaptación de modelos autorregresivos preentrenados a dLLMs es un enfoque estándar, con métodos como DiffuGPT, DiffuLLaMA, Dream y LLaDA, que se continuó preentrenando en Ling 2.0 para alcanzar 16B y 100B parámetros. El artículo también menciona los propios experimentos y desafíos de los autores.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas