Harici Nedensel Hatırlama Karşılaştırması: Yandex'in YDB'sinde AI Asistan Belleğinin Test Edilmesi
Яндекс
Bir nedensel hatırlama karşılaştırması, açık kaynaklı YDB deposunda (ydb-platform/ydb) bir AI asistanın benzer semptomlar için geçmiş düzeltmeleri ne kadar iyi geri getirdiğini ölçmek için gerçekleştirildi. Yalnızca anlamsal arama, vakaların %32,1'inde doğru PR'yi bulurken, açık nedensel kenarlar (sorun -> kapanış PR'si) boyunca dolaşmak %94,5'e ulaştı ve grafikten +62,5 puanlık bir katkı gösterdi. Desen, dil, alan veya bilet kültüründen bağımsız olarak tekrarlanıyor.
Yazarlar, herkese açık ydb-platform/ydb deposu (10.285 sorun, 37.067 çekme isteği, C++, İngilizce) üzerinde nedensel geri çağırma kıyaslama seti oluşturdu. GitHub'daki Closes/Fixes/Resolves #N desenini kullanarak altın çiftler çıkardılar (ydbot ve github-actions bot çekme isteklerini filtreledikten sonra 293 geçerli çift). Her sorgu (sorun başlığı) için iki alma yöntemi karşılaştırıldı: (a) çok dilli MiniLM gömmeleri kullanılarak anlamsal kosinüs benzerliği ile ilk 32 sonuç ve (b) aynı tohumlardan nedensel kenarların derinlik 3'e kadar taranması. Anlamsal geri çağırma %32,1 (94/293) iken nedensel geri çağırma %94,5 (277/293) oldu ve grafik katkısı +62,5 yüzde puanı sağladı. Yazarlar, asıl sonucun kesin sayılar değil, tekrarlanabilir desen olduğunu vurguluyor: anlamsal kelime benzerliği tek başına yaklaşık üçte birde kalırken, açık nedensel bağlantılar geri çağırmayı önemli ölçüde artırıyor. Bağımsız tekrarlamaya olanak sağlamak için tüm altın çiftleri ve 6 adımlı bir yöntem sağlıyorlar. Çalışma ayrıca yan bulguları da not ediyor: 143 yapay zeka ajanları (çoğunlukla GitHub Copilot) tarafından oluşturulan çekme isteği ve 173 geri alma çekme isteği, bellek sorunlarının gerçek olduğunu gösteriyor.
Kaynak: Habr — хаб ИИ —
orijinal
