Onderzoek 🇷🇺 10.08.2026 14:03

Diffusietaalmodelen: Hoe Ze Werken, Wat Werkt, en Wat Vragen Oproept

СберСбер OpenAIOpenAI MicrosoftMicrosoft
Diffusietaalmodelen (dLLM's) genereren tekst parallel, waarbij ze maskers overal in de sequentie invullen. Ze bieden voordelen zoals parallelle generatie, tekstinvulling en robuustheid tegen omgekeerde queries, maar kampen met problemen zoals geheugeninefficiëntie en generatie met vaste lengte. Het artikel bespreekt recent onderzoek, waaronder LLaDA, Plaid en flow-matching-methoden, en verkent de aanpassing van voorgetrainde autoregressieve modellen.
Diffusietaalmodele (dLLM's) genereren tekst parallel door maskers overal in te vullen, in tegenstelling tot autoregressieve LLM's die token-voor-token van links naar rechts genereren. De gemaskeerde diffusieaanpak, gerelateerd aan BERT, gebruikt een voorwaarts proces dat tokens vervangt door MASK en een omgekeerd proces dat ze herstelt. Voordelen zijn onder meer parallelle generatie, tekstinvoeging, robuustheid voor omgekeerde query's (zoals aangetoond door LLaDA) en betere prestaties met beperkte gegevens. dLLM's hebben echter last van inefficiëntie van de KV-cache, onafhankelijke tokenaanname en generatie met vaste lengte, waarvoor trucjes nodig zijn voor variabele lengte. Evaluatie gebruikt vaak perplexiteit (GenPPL) maar lijdt onder herhalingscollaps; diversiteitsmetrics zijn ook nodig. Aanpassing van vooraf getrainde autoregressieve modellen naar dLLM's is een gangbare aanpak, met methoden zoals DiffuGPT, DiffuLLaMA, Dream en LLaDA, die verder werd voorgetraind op Ling 2.0 om 16B en 100B parameters te bereiken. Het artikel vermeldt ook de eigen experimenten en uitdagingen van de auteurs.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws