MosaicLeaks: Datalek via onderzoeks-AI-agenten en de PA-DR-methode om het te voorkomen
Diepgravende onderzoeksagenten die privé-lokale documenten combineren met externe tools zoals webzoekopdrachten kunnen gevoelige informatie lekken via hun query's. Een nieuwe benchmark, MosaicLeaks, meet dit risico, en een trainingsmethode genaamd PA-DR vermindert het lekken van 34% naar 9,9% terwijl de taakprestaties behouden blijven.
MosaicLeaks is een benchmark die door onderzoekers is gecreëerd om privacylekken te bestuderen bij deep-research agents die interageren met privé lokale documenten en openbare webzoekopdrachten. Het bevat 1001 meerstaps vraagketens waarbij agents vragen moeten beantwoorden die privé- en openbare informatie combineren. Uit tests bleek dat agents regelmatig privégegevens lekken via hun webzoekopdrachten, en dat training alleen voor taakprestaties het lekken verergerde (van 34% naar 51,7%). De voorgestelde Privacy-Aware Deep Research-methode combineert een situationele taakbeloning met een aangeleerde privacybeloning, waardoor het lekken van antwoorden/volledige informatie wordt teruggebracht tot 9,9%, terwijl het strikte ketensucces op 58,7% blijft (nabij de 59,3% die met alleen taaktraining wordt bereikt). PA-DR verbetert ook de sample-efficiëntie: er zijn 5 tot 6 keer minder gegenereerde samples nodig om dezelfde taakprestatie te bereiken als bij alleen op resultaat gerichte reinforcement learning.
Bron: Hugging Face blog —
origineel
