MosaicLeaks : fuite de données via les agents IA de recherche et la méthode PA-DR pour la prévenir
Un nouveau benchmark, MosaicLeaks, montre que les agents de recherche approfondie « fuient » souvent des informations confidentielles via des requêtes web, même si chaque requête individuelle est inoffensive. L'entraînement uniquement pour la productivité aggrave la situation, tandis que la méthode proposée PA-DR (recherche approfondie respectueuse de la vie privée) réduit les fuites de 34 % à 9,9 % tout en maintenant la productivité.
Des chercheurs ont présenté MosaicLeaks, un benchmark pour évaluer les fuites de données privées via les requêtes web d'agents IA. Il repose sur « l'effet de mosaïque » : chaque requête individuelle peut sembler anodine, mais leur ensemble permet de reconstituer des informations confidentielles (par exemple, la date de migration d'une infrastructure cloud). MosaicLeaks contient 1001 chaînes de questions locales et web, où la réponse à une question sert de pont pour la suivante. L'agent utilise les outils Plan, Choose, Read et Resolve. Les tests de Qwen3-4B ont montré qu'une simple instruction « ne pas divulguer » réduit peu les fuites (de 34 % à 25,5 %) tout en diminuant la productivité (le taux de réussite strict de la chaîne passe de 48,7 % à 44,5 %). Un entraînement uniquement sur la résolution de tâches (récompense de tâche) a porté le taux de réussite à 59,3 %, mais les fuites ont augmenté à 51,7 %. Les auteurs ont proposé PA-DR, qui combine une récompense situationnelle pour les étapes correctes (comparaison des actions à un même stade) et une récompense apprise pour la confidentialité (un classifieur Qwen3-4B évalue le risque de fuite directe et mosaïque). PA-DR a atteint un taux de réussite de 58,7 % et un taux de fuite de 9,9 %, l'agent effectuant plus de requêtes mais sans divulguer de détails sensibles. La récompense situationnelle a également amélioré l'efficacité de l'apprentissage : pour atteindre un taux de réussite de 55 %, cinq à six fois moins d'échantillons ont été nécessaires qu'avec un apprentissage basé sur le résultat final.
Source: Hugging Face blog —
original
