MosaicLeaks: Araştırma Yapay Zeka Ajanları Aracılığıyla Veri Sızıntısı ve Bunu Önlemek İçin PA-DR Yöntemi
Özel yerel belgeleri web araması gibi harici araçlarla birleştiren derin araştırma ajanları, sorguları aracılığıyla hassas bilgileri sızdırabilir. MosaicLeaks adlı yeni bir kıyaslama ölçütü bu riski ölçer ve PA-DR adlı bir eğitim yöntemi, görev performansını korurken sızıntıyı %34'ten %9,9'a düşürür.
MosaicLeaks, araştırmacılar tarafından özel yerel belgeler ile genel web aramasını birleştiren derin araştırma ajanlarının mahremiyet sızıntısını incelemek için oluşturulmuş bir kıyaslamadır. Özel ve genel bilgileri birbirine bağlayan soruları yanıtlaması gereken ajanlar için 1.001 çok adımlı soru zinciri içerir. Testler, ajanların web sorguları aracılığıyla sık sık özel veri sızdırdığını ve yalnızca görev performansı için eğitimin sızıntıyı daha da kötüleştirdiğini (%34'ten %51,7'ye) gösterdi. Önerilen Gizlilik Bilincine Sahip Derin Araştırma yöntemi, durumsal bir görev ödülünü öğrenilmiş bir gizlilik ödülüyle birleştirerek cevap/tam bilgi sızıntısını %9,9'a düşürürken, katı zincir başarısını %58,7'de (yalnızca görev eğitimi ile elde edilen %59,3'e yakın) tutar. PA-DR ayrıca örnek verimliliğini artırarak, yalnızca sonuç temelli pekiştirmeli öğrenmeyle aynı görev performansına ulaşmak için gereken üretilen örnek sayısını 5-6 kat azaltır.
Kaynak: Hugging Face blog —
orijinal
