AraştırmaAjanlar 🇺🇸 27.07.2026 07:02

ABBEL: Training LLMs to Update Beliefs for Efficient Long-term Interaction

CursorCursor Alibaba/QwenAlibaba/Qwen
ABBEL is a framework for training language models to update beliefs in the form of textual states, enabling efficient context compression during long-term interactions. The method uses belief grading through observation reconstruction, reducing the gap with full-context models in collaborative programming and other tasks.
BAIR araştırmacıları, uzun süreli etkileşimlerde LLM bağlamının ölçeklendirilmesi sorununu çözen ABBEL (Autoencoder Belief Bottleneck for Efficient Learning) çerçevesini tanıttı. Geleneksel özyinelemeli özetleme (bağlam sıkıştırma), özellikle işbirlikçi kod üretimi gibi kaliteli veri eksikliği olan görevlerde performansı düşürür. ABBEL, özetleme görevini, etkileşim geçmişinin metinsel temsilleri olan inanç durumlarının (belief states) güncellenmesi olarak formüle ederek izole eder. Eğitim için inanç derecelendirmesi (belief grading) kullanılır: model, mevcut inanç durumundan son gözlemin ne kadar iyi yeniden yapılandırılabileceğine göre ödüllendirilir. CollabBench (işbirlikçi programlama) ortamında, yeniden yapılandırmalı derecelendirme ile ABBEL, tam bağlamlı modellerle olan farkı yaklaşık %50 oranında azaltır ve inanç derecelendirmesi olmadan iki kat daha hızlı öğrenir. Combination Lock oyun simülasyonunda, alan bilgisi kullanan derecelendirme yöntemi, tam bağlamlı modellerin performansına ulaşır veya onu geçer. Çok görevli soru-cevap ortamında, Tepe İnanç Cezası (Peak Belief Penalty) eklenmesi, kalitede önemli bir düşüş olmadan bellek kullanımını önemli ölçüde azaltır. ABBEL, özetleme için O(N/K) ek yük kullanır; burada N toplam eylem sayısı, K ise özetleme çalıştırmaları arasındaki eylem sayısıdır. Araştırmacılar, gelecekte daha güçlü sistemler için farklı bellek türlerinin (çalışma, kısa ve uzun süreli) kombinasyonlarının mümkün olabileceğini belirtiyor.
Kaynak: BAIR (Berkeley AI) — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler