Araştırma 🇷🇺 10.08.2026 14:03

Difüzyon Dil Modelleri: Nasıl Çalışırlar, Ne İşe Yarar ve Hangi Soruları Gündeme Getirirler

СберСбер OpenAIOpenAI MicrosoftMicrosoft
Difüzyon dil modelleri (dLLM'ler), metni paralel olarak üretir ve dizinin herhangi bir yerindeki boşlukları doldurur. Paralel üretim, metin içi boşluk doldurma ve ters sorgulara karşı dayanıklılık gibi avantajlar sunarlar; ancak bellek verimsizliği ve sabit uzunlukta üretim gibi sorunlarla karşılaşırlar. Makale, LLaDA, Plaid ve akış eşleştirme yöntemleri dahil olmak üzere son araştırmaları tartışıyor ve önceden eğitilmiş otoregresif modellerin uyarlanmasını inceliyor.
Diffüzyon dil modelleri (dLLM'ler), otoregresif LLM'lerin soldan sağa belirteç belirteç üretmesinin aksine, metni paralel olarak üretir ve maskeleri her yerde doldurur. BERT ile ilişkili olan maskeli diffüzyon yaklaşımı, belirteçleri MASK ile değiştiren bir ileri süreç ve onları geri getiren bir ters süreç kullanır. Avantajları arasında paralel üretim, metin doldurma, ters sorgulara karşı sağlamlık (LLaDA'nın gösterdiği gibi) ve sınırlı veriyle daha iyi performans yer alır. Ancak dLLM'ler, KV-önbellek verimsizliği, bağımsız belirteç varsayımı ve sabit uzunlukta üretim nedeniyle değişken uzunluk için hileler gerektirir. Değerlendirme genellikle şaşkınlık (GenPPL) kullanır, ancak tekrar çöküşünden muzdariptir; çeşitlilik metriklerine de ihtiyaç vardır. Önceden eğitilmiş otoregresif modelleri dLLM'lere uyarlamak standart bir yaklaşımdır ve DiffuGPT, DiffuLLaMA, Dream ve LLaDA gibi yöntemlerle, Ling 2.0 üzerinde devam eden ön eğitimle 16B ve 100B parametrelere ulaşan LLaDA'yı içerir. Makale ayrıca yazarların kendi deneylerinden ve zorluklarından da bahseder.
Kaynak: Habr — хаб ИИ — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler