Recherche 🇷🇺 10.08.2026 14:03

Modèles de langage à diffusion : leur fonctionnement, ce qui fonctionne, et ce qui soulève des questions

СберСбер OpenAIOpenAI MicrosoftMicrosoft
Les modèles de langage à diffusion (dLLM) génèrent du texte en parallèle, en remplissant des masques à n'importe quel endroit de la séquence. Ils offrent des avantages tels que la génération parallèle, le remplissage de texte et la robustesse aux requêtes inversées, mais rencontrent des problèmes comme l'inefficacité de la mémoire et la génération à longueur fixe. Cet article examine les recherches récentes, notamment LLaDA, Plaid, et les méthodes de flux-matching, et explore l'adaptation des modèles autorégressifs pré-entraînés.
Les modèles de langage à diffusion (dLLMs) génèrent du texte en parallèle, remplissant des masques n'importe où, contrairement aux LLM autorégressifs qui génèrent token par token de gauche à droite. L'approche de diffusion masquée, liée à BERT, utilise un processus direct qui remplace les tokens par MASK et un processus inverse qui les restaure. Les avantages incluent la génération en parallèle, le remplissage de texte, la robustesse aux requêtes inversées (comme le montre LLaDA), et de meilleures performances avec des données limitées. Cependant, les dLLMs souffrent d'une inefficacité du cache KV, de l'hypothèse d'indépendance des tokens, et d'une génération à longueur fixe, nécessitant des astuces pour des longueurs variables. L'évaluation utilise souvent la perplexité (GenPPL) mais souffre de l'effondrement par répétition ; des métriques de diversité sont également nécessaires. L'adaptation de modèles autorégressifs pré-entraînés aux dLLMs est une approche standard, avec des méthodes comme DiffuGPT, DiffuLLaMA, Dream, et LLaDA, qui a été poursuivi en pré-entraînement sur Ling 2.0 pour atteindre 16B et 100B paramètres. L'article mentionne également les propres expériences des auteurs et les défis rencontrés.
Source: Habr — хаб ИИ — original
Nos articles précédents sur ce sujet ↓
Infos fraîches