MosaicLeaks: تسرب البيانات عبر وكلاء البحث بالذكاء الاصطناعي وطريقة PA-DR لمنعه
معيار جديد، MosaicLeaks، يُظهر أن وكلاء البحث العميق غالبًا ما "يسربون" معلومات سرية عبر طلبات الويب، حتى لو كانت كل طلب فردي غير ضار. التدريب فقط من أجل الإنتاجية يزيد الوضع سوءًا، بينما الطريقة المقترحة PA-DR (البحث العميق الواعي بالخصوصية) تُقلل التسرب من 34% إلى 9.9% مع الحفاظ على الإنتاجية.
Исследователи представили MosaicLeaks — бенчмарк для оценки утечки приватных данных через веб-запросы ИИ-агентов. В основе лежит «эффект мозаики»: каждый отдельный запрос может казаться безобидным, но в совокупности они позволяют восстановить конфиденциальную информацию (например, дату миграции облачной инфраструктуры). MosaicLeaks содержит 1001 цепочку из локальных и веб-вопросов, где ответ на один вопрос служит мостом для следующего. Агент использует инструменты Plan, Choose, Read и Resolve. Тестирование Qwen3-4B показало, что простая инструкция «не разглашать» снижает утечку незначительно (с 34% до 25,5%) и при этом ухудшает продуктивность (strict chain success падает с 48,7% до 44,5%). Обучение только решению задач (task reward) подняло success до 59,3%, но утечка выросла до 51,7%. Авторы предложили PA-DR, объединяющий ситуационную награду за корректные шаги (сравнение действий на одном этапе) и выученную награду за приватность (классификатор Qwen3-4B оценивает риск прямой и мозаичной утечки). PA-DR достиг success 58,7% и утечки 9,9%, при этом агент выполнял больше запросов, но без раскрытия чувствительных деталей. Ситуационная награда также повысила эффективность обучения: для достижения 55% success потребовалось в 5-6 раз меньше сэмплов, чем при обучении по конечному результату.
المصدر: Hugging Face blog —
الأصلي
