AI安全研究 🇺🇸 27.07.2026 12:02

MosaicLeaks:通过研究型AI代理的数据泄露及PA-DR防范方法

新基准测试MosaicLeaks表明,深度研究代理经常通过网络请求“泄露”机密信息,即使每个单独请求看似无害。仅针对生产力进行训练会使情况恶化,而提出的PA-DR(隐私感知深度研究)方法将泄露率从34%降至9.9%,同时保持生产力。
研究人员提出了MosaicLeaks基准测试,用于评估AI代理通过网页请求泄露隐私数据的风险。该基准基于“马赛克效应”:单个请求看似无害,但组合起来可恢复敏感信息(例如云基础设施的迁移日期)。MosaicLeaks包含1001个由本地和网络问题组成的链,其中一个问题答案是下一个问题的桥梁。代理使用Plan、Choose、Read和Resolve工具。对Qwen3-4B的测试表明,简单的“禁止泄露”指令仅将泄露率从34%小幅降至25.5%,同时降低生产力(strict chain success从48.7%降至44.5%)。仅任务奖励训练将成功率提升至59.3%,但泄露率升至51.7%。作者提出了PA-DR,它结合了情境奖励(对单步正确行动的评估)和学到的隐私奖励(Qwen3-4B分类器评估直接和“马赛克”泄露风险)。PA-DR实现了58.7%的成功率和9.9%的泄露率,代理执行了更多请求,但未泄露敏感细节。情境奖励还提高了训练效率:达到55%成功率所需的样本量比最终结果奖励训练少5-6倍。
来源: Hugging Face blog — 原文
我们之前关于此话题的帖子 ↓
最新新闻