Tutkimus 🇷🇺 10.08.2026 14:03

Diffuusiokielimallit: miten ne toimivat, mikä toimii ja mitä kysymyksiä ne herättävät

СберСбер OpenAIOpenAI MicrosoftMicrosoft
Diffuusiokielimallit (dLLM) tuottavat tekstiä rinnakkain täyttämällä aukkoja missä tahansa sekvenssissä. Ne tarjoavat etuja, kuten rinnakkaisen tuottamisen, tekstin täydentämisen ja kestävyyden käänteisille kyselyille, mutta niillä on myös ongelmia, kuten muistin tehottomuus ja kiinteän mittainen tuottaminen. Artikkelissa käsitellään viimeaikaista tutkimusta, mukaan lukien LLaDA, Plaid ja flow-matching-menetelmät, sekä tutkitaan esikoulutettujen autoregressiivisten mallien mukauttamista.
Diffuusiokielimallit (dLLM:t) tuottavat tekstiä rinnakkain täyttämällä maskeja missä tahansa, toisin kuin autoregressiiviset kielimallit, jotka tuottavat tokenin kerrallaan vasemmalta oikealle. Maskoitu diffuusio, joka liittyy BERT-malliin, käyttää eteenpäin suuntautuvaa prosessia, joka korvaa tokenit MASK-merkillä, ja taaksepäin suuntautuvaa prosessia, joka palauttaa ne. Etuja ovat rinnakkainen tuottaminen, tekstin täyttö, kestävyys käänteisille kyselyille (kuten LLaDA on osoittanut) ja parempi suorituskyky rajoitetulla datamäärällä. dLLM:t kärsivät kuitenkin KV-välimuistin tehottomuudesta, riippumattomien tokenien oletuksesta ja kiinteän pituuden tuottamisesta, mikä vaatii temppuja muuttuvan pituuden käsittelyyn. Arvioinnissa käytetään usein perplexityä (GenPPL), mutta se kärsii toistokollapsista; myös monimuotoisuusmittareita tarvitaan. Esikoulutettujen autoregressiivisten mallien mukauttaminen dLLM:iksi on vakiomenetelmä, ja esimerkkejä ovat DiffuGPT, DiffuLLaMA, Dream ja LLaDA, jota jatkokoulutettiin Ling 2.0 -aineistolla 16 ja 100 miljardin parametrin kokoon. Artikkelissa mainitaan myös tekijöiden omat kokeet ja haasteet.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset