Yapay Zeka Ajanı Hafızası Sahte Raporu Nasıl Engelledi ve Kendi Özelliğini Terk Ettirdi
Vecmory adlı bir hafıza sistemi kuran bir yapay zeka ajanı, kendi geçmiş notlarını hatırlayarak iki kez zararlı eylemlerden kaçındı. İlk vaka, gerçek verilerde işe yaramayan şişirilmiş 0.98 korelasyona sahip bir yönlendiriciyi durdurdu; ikincisi ise ekibi, alım kalitesini düşürdüğünü ölçtükten sonra sevilen bir özelliği (düğüm önemi) terk etmeye zorladı. Kilit ders: Yazarı çelişkiye düşüren hafıza, sadece yankı yapan hafızadan daha değerlidir.
vecmory ekibi, AI ajanları için hatırlama, hatırda tutma ve bağlantı kurma olmak üzere üç işleme odaklanan bir semantik bellek inşa ediyor. Ajan, kendi belleğine geliştirme notları yazar. Bir oturumda, kosinüs ve grafik tabanlı sıralama arasında seçim yapacak bir yönlendirici önerdi ve sentetik bir korelasyon olan 0,98 gösterdi. Başarıyı raporlamadan önce, daha önceki bir notu hatırladı: bu not, aynı fikrin gerçek verilerde başarısız olduğunu, çünkü sentetik gömütlerin (embeddings) benzer ile farklıyı yanlış bir şekilde ayırdığını – gerçek kosinüs dağılımlarının büyük ölçüde örtüştüğünü – gösteriyordu. Ajan raporu iptal etti. İkinci bir durumda, varsayılan sıralama kosinüsü düğüm iç derecesi (önem) ile karıştırıyordu. Gerçek sorgu-cevap çiftleri üzerinde yapılan ölçümler, saf kosinüsün Ortalama Karşılıklı Sıralama (Mean Reciprocal Rank, MRR) değerinin 0,81 olduğunu, akıllı harmanın ise yalnızca 0,41'e ulaştığını gösterdi; çünkü küresel popülerlik, nadir belirli gerçekleri boğuyordu. Ekip, önemi varsayılandan çıkardı ve Grafik Kişiselleştirilmiş PageRank (Personalized PageRank, PPR) seçeneğini bıraktı. Ajanın belleği böylece kendi sevdiği özelliği çürüttü. Ekip ayrıca gerçek bir GitHub hata bildirimi deposunda nedensel hatırlamayı ölçtü: saf kosinüs vakaların %38'inde doğru Çekme İsteğini (Pull Request, PR) bulurken, neden-sonuç grafiği kenarlarında gezinme bu oranı %87'ye çıkardı. Makale, belleğin en değerli olduğu zamanın, yazarıyla çeliştiği zaman olduğu, varsayımları pekiştirdiği zaman değil, sonucuna varıyor.
Kaynak: Habr — хаб ML —
orijinal
