Standart DDD'lerin Ötesinde: Doğrusal Dikkat Melezleri, Metin Difüzyonu, Kod Dünya Modelleri ve Küçük Özyinelemeli Dönüştürücüler
Moonshot AI
MiniMax
Alibaba/Qwen
DeepSeek
Google/DeepMind
Mistral
Meta
Hugging Face
Sebastian Raschka'nın makalesi, standart otoregresif dönüştürücü DDD'lerin alternatiflerini inceliyor: doğrusal dikkat melezleri (örneğin, MiniMax-M1, Qwen3-Next, DeepSeek V3.2, Kimi Linear), metin difüzyon modelleri, kod dünya modelleri ve küçük özyinelemeli dönüştürücüler. Doğrusal dikkat mekanizmalarının yeniden canlanmasını ve MiniMax'in M2 modelinde akıl yürütme görevlerinde düşük performans nedeniyle standart dikkate geri dönmesi gibi zorlukları tartışıyor.
Sebastian Raschka, çok başlı dikkat mekanizması üzerine inşa edilen standart otoregresif kod çözücü tipi dönüştürücülere alternatifleri tartışıyor. Öne çıkan modeller arasında yıldırım dikkatli MiniMax-M1, Geçitli DeltaNet ve Geçitli Dikkat ile Qwen3-Next, seyrek dikkatli DeepSeek V3.2 ve Kimi Linear yer alıyor. Ancak MiniMax, M2 modelinde normal dikkat mekanizmasına geri dönerek bunun nedenini akıl yürütme ve çok adımlı görevlerdeki zayıf doğruluk olarak açıkladı. Qwen3-Next ve Kimi Linear, doğrusal dikkat (Geçitli DeltaNet) ile tam dikkat (Geçitli Dikkat) arasında 3:1 oranı kullanıyor. Geçitli DeltaNet, Mamba2'yi yinelenen durum güncellemeleri için delta kuralıyla birleştiriyor. Makale ayrıca metin difüzyon modelleri, kod dünya modelleri ve küçük yinelemeli dönüştürücüler gibi diğer alternatiflerden de bahsediyor, ancak bunları detaylandırmıyor.
Kaynak: Sebastian Raschka —
orijinal
