AI安全研究 🇺🇸 27.07.2026 12:02

MosaicLeaks:通过研究型AI代理造成的数据泄露及PA-DR预防方法

深度研究代理将私人本地文档与网络搜索等外部工具结合时,可能通过其查询泄露敏感信息。新基准MosaicLeaks衡量了这一风险,而名为PA-DR的训练方法将泄漏率从34%降至9.9%,同时保持了任务性能。
MosaicLeaks 是由研究人员创建的一个基准测试,用于研究深度研究代理在交织私有本地文档和公共网络检索时的隐私泄露问题。该基准包含 1,001 条多跳问题链,代理必须回答这些跨越私密和公共信息的问题。测试表明,代理经常通过网络查询泄露私有数据,而仅针对任务性能进行训练会加剧泄露(从 34% 升至 51.7%)。提出的隐私感知深度研究(Privacy-Aware Deep Research,PA-DR)方法结合了情境任务奖励与学习到的隐私奖励,将答案/完整信息泄露降至 9.9%,同时保持严格的链式任务成功率为 58.7%(接近仅任务训练所达到的 59.3%)。PA-DR 还提高了样本效率,达到相同任务性能所需的生成样本量比仅基于结果的强化学习少 5-6 倍。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻