An toàn AINghiên cứu 🇺🇸 27.07.2026 12:02

MosaicLeaks: Rò rỉ dữ liệu qua tác nhân AI nghiên cứu và phương pháp PA-DR để ngăn chặn

Các tác nhân nghiên cứu chuyên sâu kết hợp tài liệu địa phương riêng tư với các công cụ bên ngoài như tìm kiếm web có thể làm rò rỉ thông tin nhạy cảm thông qua các truy vấn của chúng. Một chuẩn mới, MosaicLeaks, đo lường rủi ro này, và một phương pháp huấn luyện gọi là PA-DR giảm rò rỉ từ 34% xuống 9,9% trong khi vẫn duy trì hiệu suất nhiệm vụ.
MosaicLeaks là một benchmark được các nhà nghiên cứu tạo ra để nghiên cứu rò rỉ quyền riêng tư từ các tác nhân nghiên cứu sâu (deep-research agents) kết hợp giữa tài liệu địa phương riêng tư và truy xuất web công cộng. Nó bao gồm 1.001 chuỗi câu hỏi đa bước, trong đó các tác nhân phải trả lời các câu hỏi kết nối thông tin riêng tư và công khai. Kiểm thử cho thấy các tác nhân thường xuyên rò rỉ dữ liệu riêng tư qua các truy vấn web của chúng, và việc huấn luyện chỉ tập trung vào hiệu suất nhiệm vụ làm cho rò rỉ trở nên tồi tệ hơn (từ 34% lên 51,7%). Phương pháp Nghiên cứu sâu có nhận thức về quyền riêng tư (Privacy-Aware Deep Research - PA-DR) được đề xuất kết hợp phần thưởng nhiệm vụ tình huống (situational task reward) với phần thưởng quyền riêng tư học được (learned privacy reward), giúp giảm rò rỉ câu trả lời/thông tin đầy đủ xuống 9,9% trong khi vẫn duy trì tỷ lệ thành công chuỗi nghiêm ngặt ở mức 58,7% (gần với 59,3% đạt được khi chỉ huấn luyện nhiệm vụ). PA-DR cũng cải thiện hiệu quả mẫu, yêu cầu số mẫu sinh ra ít hơn 5-6 lần để đạt cùng hiệu suất nhiệm vụ so với học tăng cường chỉ dựa trên kết quả (outcome-only reinforcement learning).
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới