MosaicLeaks: Tietovuoto tutkimus-AI-agenttien kautta ja PA-DR-menetelmä sen estämiseksi
Uusi vertailuarvo, MosaicLeaks, osoittaa, että syvät tutkimusagentit "vuotavat" usein luottamuksellista tietoa verkkopyyntöjen kautta, vaikka jokainen yksittäinen pyyntö on harmiton. Vain tuottavuuteen keskittyvä harjoittelu pahentaa tilannetta, kun taas ehdotettu menetelmä PA-DR (Privacy-Aware Deep Research) vähentää vuotoja 34 prosentista 9,9 prosenttiin säilyttäen samalla tuottavuuden.
Tutkijat esittelivät MosaicLeaksin, vertailuarvon tekoälyagenttien verkkokyselyjen kautta tapahtuvan yksityisten tietojen vuotamisen arviointiin. Sen perustana on mosaiikkiefekti: jokainen yksittäinen kysely saattaa vaikuttaa vaarattomalta, mutta yhdessä ne mahdollistavat luottamuksellisen tiedon palauttamisen (esimerkiksi pilvi-infrastruktuurin siirtopäivämäärän). MosaicLeaks sisältää 1001 paikallisten ja verkossa esitettävien kysymysten ketjua, joissa vastaus yhteen kysymykseen toimii siltana seuraavalle. Agentti käyttää työkaluja Plan, Choose, Read ja Resolve. Qwen3-4B:n testaus osoitti, että yksinkertainen ohje 'älä paljasta' vähentää vuotoa vain vähän (34 prosentista 25,5 prosenttiin) ja samalla heikentää tuottavuutta (strict chain success putoaa 48,7 prosentista 44,5 prosenttiin). Pelkkä tehtävien ratkaisemiseen keskittyvä harjoittelu (task reward) nosti successin 59,3 prosenttiin, mutta vuoto kasvoi 51,7 prosenttiin. Kirjoittajat ehdottivat PA-DR:ää, joka yhdistää tilannekohtaisen palkkion oikeista vaiheista (toimien vertailu samassa vaiheessa) ja opitun palkkion yksityisyydestä (Qwen3-4B-luokittelija arvioi suoran ja mosaiikkivuodon riskiä). PA-DR saavutti 58,7 prosentin successin ja 9,9 prosentin vuodon, ja agentti teki enemmän kyselyjä paljastamatta kuitenkaan arkaluontoisia yksityiskohtia. Tilannekohtainen palkkio paransi myös harjoittelun tehokkuutta: 55 prosentin successin saavuttamiseen tarvittiin 5–6 kertaa vähemmän näytteitä kuin lopputulokseen perustuvassa harjoittelussa.
Lähde: Hugging Face blog —
Alkuperäinen
