LLM Sohbet Robotlarının Eksik Olduğu Şey: Amaç Duygusu
OpenAI
Meta
Modern LLM sohbet robotları, tek seferlik sorgularda başarılı olurken çok turlu diyaloglarda odak kaybı yaşıyor. Araştırmalar, modellerin birkaç konuşma turunun ardından sistem yönergesinden hızla saptığını gösteriyor. Yazar, uzun vadeli hedefleri ve yinelemeli etkileşimi hesaba katan "amaç odaklı diyalog" yaklaşımını öneriyor.
LLM sohbet botları sürekli gelişiyor, ancak ilerlemeleri tek seferlik yanıtları test eden MMLU, HumanEval ve MATH gibi kıyaslamalarla ölçülüyor. Oysa seyahat planlaması veya GitHub sorunlarını otomatikleştirme gibi gerçek dünya görevleri, gereksinimlerin iyileştirildiği çok turlu diyaloglar gerektiriyor. Araştırmacılar, LLaMA2-chat-70B ve GPT-3.5-turbo-16k gibi gelişmiş modellerin bile yaklaşık 1,6 bin token (yaklaşık 16 tur) sonra sistem yönlendirmesine uymayı bıraktığını gösterdi. Bu, iki LLM aracısının birbiriyle iletişim kurduğu ve ardından her birinin talimatını ne kadar iyi takip ettiğinin kontrol edildiği bir deneyle doğrulandı. Sorun, İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF) yoluyla yapılan eğitimin çok adımlı planlamayı hesaba katmamasıdır; uzun vadeli hedefler yerine tek seferlik yanıtları optimize eder. Yazar, sohbet botunun kullanıcının niyetlerini kademeli olarak netleştiren bir asistan gibi davrandığı 'hedef odaklı diyalog' yaklaşımını öneriyor. Bu tür sistemlere örnek olarak 'çözüm odaklı diyalog' ve işbirlikçi karar almayı modelleyen Sotopia platformu verilebilir. Gerçek asistanlar yaratmak için sadece metin üretmek değil, diyalogları her sözcenin muhatabın dünya modelini değiştirdiği hedef odaklı oyunlar olarak tasarlamak gerekiyor.
Kaynak: The Gradient —
orijinal
