ABBEL: Büyük Dil Modellerini Uzun Süreli Etkileşimde Verimlilik İçin İnanç Güncellemeye Eğitme
Cursor
Alibaba/Qwen
ABBEL, büyük dil modellerinin (LLM'ler) uzun vadeli görevlerdeki performansını, özetlerin bilgi içeriğini doğal dil inanç durumları kullanarak izole edip denetleyerek iyileştiren bir çerçevedir. Tam bağlamlı modellere kıyasla performans açığını yaklaşık %50 oranında azaltırken, eğitim adımlarını yarıya indirir ve önemli ölçüde daha az bellek kullanır.
ABBEL (Autoencoder Belief Bottleneck for Efficient Learning), LLM'lerin bağlam penceresine sığmayan uzun etkileşimlerde yaşadığı sorunu ele alır. Geleneksel özyinelemeli özetleme yerine, ABBEL özetleri modelin periyodik olarak güncellediği inanç durumları olarak formüle eder. İnanç derecelendirme, inançların son gözlemleri ne kadar iyi yeniden yapılandırabildiğine göre ödüllendiren yardımcı bir takviyeli öğrenme görevi ekler. CollabBench işbirlikçi kodlama ortamında, yeniden yapılandırma tabanlı inanç derecelendirmesi ile ABBEL, 0,48 test geçme oranı (tam bağlam için 0,52'ye karşı) ve 0,36 başarı oranı (0,39'a karşı) elde ederken, tam bağlam için 14,08 olan tepe token kullanımına karşı 6,01 tepe token kullandı ve 100 eğitim adımı yerine yalnızca 50 eğitim adımı gerektirdi. Combination Lock görevinde, alan bilgisi tabanlı inanç derecelendirmesi ABBEL'in tam bağlam performansına yaklaşmasını veya onu aşmasını sağladı. Çok amaçlı soru-cevap'ta, bir Tepe İnanç Uzunluğu Cezası, minimum performans kaybıyla bellek kullanımını azalttı. Makale, Berkeley AI'den Lidayan ve arkadaşları tarafından yazılmıştır.
Kaynak: BAIR (Berkeley AI) —
orijinal
