AI安全性研究 🇺🇸 27.07.2026 12:02

MosaicLeaks:研究用AIエージェントによるデータ漏洩とその防止手法PA-DR

プライベートなローカル文書とWeb検索などの外部ツールを組み合わせるディープリサーチエージェントは、そのクエリを通じて機密情報を漏洩させる可能性があります。新たなベンチマークMosaicLeaksはこのリスクを測定し、PA-DRと呼ばれるトレーニング手法はタスク性能を維持しつつ漏洩率を34%から9.9%に低減します。
MosaicLeaksは、ローカルのプライベート文書と公開Web検索を組み合わせたディープリサーチエージェントによるプライバシー漏洩を研究するために研究者らが作成したベンチマークです。プライベート情報と公開情報を橋渡しする質問にエージェントが答えなければならない1,001のマルチホップ質問連鎖で構成されています。テストの結果、エージェントはWebクエリを通じて頻繁にプライベートデータを漏洩し、タスクパフォーマンスのみを目的とした訓練では漏洩が悪化することがわかりました(34%から51.7%に増加)。提案されたプライバシー認識ディープリサーチ(PA-DR)手法は、状況タスク報酬と学習されたプライバシー報酬を組み合わせ、厳格な連鎖成功を58.7%(タスクのみの訓練で達成された59.3%に近い)に維持しながら、回答/全情報の漏洩を9.9%に削減します。PA-DRはまた、サンプル効率を向上させ、結果のみの強化学習と同じタスクパフォーマンスに到達するために必要な生成サンプル数が5~6分の1で済みます。
出典: Hugging Face blog — 原文
関連記事 ↓
新着ニュース