Seguridad de IAModelos 🇷🇺 24.07.2026 11:01

La Inyección de Prompts No Se Cura con Filtros: Cómo Aislar Texto No Confiable Mediante Patrones Arquitectónicos

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
La inyección de prompts sigue siendo un fallo estructural en las aplicaciones de LLM, que no se resuelve con indicaciones del sistema ni clasificadores. Patrones arquitectónicos como Dual-LLM, CaMeL de Google DeepMind y la Regla de los Dos Agentes de Meta proporcionan un aislamiento robusto. El artículo detalla el modelo de amenaza, la vulnerabilidad EchoLeak en Microsoft 365 Copilot y una implementación concreta con tres modelos aislados.
La inyección de instrucciones, introducida por Simon Willison en septiembre de 2022, ocurre cuando un texto no confiable en el contexto de un LLM es ejecutado como una instrucción. A diferencia del jailbreaking, afecta a aplicaciones donde el modelo tiene acceso a herramientas y datos, lo que lleva a ataques de 'confused deputy' y de exfiltración de datos. El artículo sostiene que los mensajes del sistema y los clasificadores de barreras protectoras son ineficaces, citando un estudio de 2025 de OpenAI, Anthropic y Google DeepMind que mostró que los ataques adaptativos evitan 12 defensas publicadas con más del 90% de éxito. El 'trío letal' de Simon Willison identifica tres ingredientes para la exfiltración de datos: acceso a datos privados, contacto con contenido no confiable y un canal de salida. La vulnerabilidad EchoLeak (CVE-2025-32711) en Microsoft 365 Copilot explotó los tres. La 'Regla de Dos de Agentes' de Meta establece que un agente no debe tener más de dos de tres propiedades: procesar entrada no confiable, acceder a sistemas/datos sensibles y poder cambiar el estado o comunicarse externamente. Arquitecturas como Dual-LLM (Willison, 2023) separan un LLM privilegiado (con herramientas, que solo ve entrada confiable) de un LLM en cuarentena (sin herramientas, que maneja texto no confiable), conectados por un controlador determinista. CaMeL de Google DeepMind (2024) utiliza un verificador para forzar que el modelo en cuarentena genere solo un subconjunto estricto de tokens permitidos. Seis patrones de proyecto de un artículo de 2025 extienden esta idea. Se describe una implementación concreta utilizando tres modelos aislados para un generador de preguntas frecuentes: uno privilegiado con acceso a datos y herramientas de la empresa, uno en cuarentena para texto de página no confiable y uno para síntesis, con comprobaciones deterministas entre ellos.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas