Seguridad de IAInvestigación 🇺🇸 27.07.2026 12:02

MosaicLeaks: Filtración de datos a través de agentes de IA de investigación y el método PA-DR para prevenirla

Un nuevo punto de referencia, MosaicLeaks, muestra que los agentes de investigación profunda a menudo "filtran" información confidencial a través de solicitudes web, incluso cuando cada solicitud individual es inofensiva. Entrenar solo para la productividad empeora la situación, mientras que el método propuesto PA-DR (Investigación Profunda Consciente de la Privacidad) reduce la filtración del 34% al 9,9% manteniendo la productividad.
Investigadores han presentado MosaicLeaks, un benchmark para evaluar la filtración de datos privados a través de peticiones web de agentes de IA. Se basa en el «efecto mosaico»: cada petición individual puede parecer inofensiva, pero en conjunto permiten reconstruir información confidencial (por ejemplo, la fecha de migración de una infraestructura en la nube). MosaicLeaks contiene 1001 cadenas de preguntas locales y web, donde la respuesta a una pregunta sirve de puente para la siguiente. El agente utiliza las herramientas Plan, Choose, Read y Resolve. Las pruebas con Qwen3-4B mostraron que una simple instrucción de «no divulgar» reduce la filtración de forma insignificante (del 34% al 25,5%) y además empeora la productividad (el strict chain success cae del 48,7% al 44,5%). El entrenamiento solo en la resolución de tareas (task reward) elevó el success al 59,3%, pero la filtración aumentó al 51,7%. Los autores propusieron PA-DR, que combina una recompensa situacional por pasos correctos (comparación de acciones en una misma etapa) y una recompensa aprendida por privacidad (un clasificador Qwen3-4B evalúa el riesgo de filtración directa y mosaico). PA-DR alcanzó un success del 58,7% y una filtración del 9,9%, mientras el agente realizaba más peticiones, pero sin revelar detalles sensibles. La recompensa situacional también mejoró la eficiencia del aprendizaje: para alcanzar un 55% de success se necesitaron entre 5 y 6 veces menos muestras que con el entrenamiento basado en el resultado final.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas