Yapay Zeka Ajanları: Hataları Paralelleştirmeden İşleri Paralelleştirin
OpenAI
Anthropic
Anthropic araştırmacılarının da dahil olduğu bir çalışma, Horizon adlı bir kıyaslama ölçütü tanıtıyor ve 3.100'den fazla ajan yörüngesini analiz ediyor. Sonuçlar, yapay zeka ajan performansının belirli bir görev karmaşıklığının ötesinde aniden çökebileceğini ve başarısızlıkların yüzde 72,5'inin süreçle ilgili risklere atfedildiğini gösteriyor. Anthropic, aşamaları değil bağımsız projeleri bölmeyi tavsiye ediyor.
Araştırmacılar, Horizon adında bir kıyaslama geliştirdi ve web, işletim sistemleri, veritabanları ve gömülü ortamlar dahil olmak üzere çeşitli ortamlarda 3.100'den fazla aracı gidişatını analiz etti. Deneyler, OpenAI ve Anthropic'ten modeller kullanan aracıları içeriyordu. Bulgular, performansın görevler uzadıkça kademeli olarak bozulmadığını, ancak belirli bir eşiğin ötesinde sabit kalıp aniden çökebileceğini ortaya koyuyor. İki aileye ayrılan yedi büyük hata kategorisi belirlendi: %72,5'i süreçle ilgili risklerle, %27,5'i aracı tasarımı riskleriyle ilişkilendirildi. Anthropic, 'bağlam kirliliği' adı verilen bir olguyu vurguluyor; burada biriken ara bilgiler aracının bağlamını karmaşıklaştırıyor ve muhakemesini bozuyor. Çalışma, bir görevi bağımsız alt görevlere bölmenin işe yaradığını, ancak çok fazla bağlamı paylaşan tasarım, uygulama ve test gibi aşamaları bölmenin, kulaktan kulağa oyununa benzer şekilde bilgi kaybına yol açtığını öne sürüyor. Yöneticiler için dört soru anahtardır: kararı kim verdi, hangi bilgiye dayanarak, hangi maliyetle ve tek bir başarısız adım bağımsız olarak yeniden oynatılabilir mi? Yeniden oynatılabilirlik olmadan, olaylar her şeyi yeniden başlatır ve uygunsuz bölme, tek bir aracıdan 3 ila 10 kat daha pahalıya mal olabilir.
Kaynak: Le Monde Informatique — IA —
orijinal
