Seguridad de IAInvestigación 🇷🇺 24.07.2026 11:01

La inyección de instrucciones no se cura con filtros: cómo aislar texto no confiable usando patrones arquitectónicos

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
La inyección de instrucciones es un defecto estructural en los modelos de lenguaje grandes donde el texto no confiable se ejecuta como una instrucción. Los filtros y las instrucciones del sistema son ineficaces: incluso las mejores defensas son vulneradas en el 90% de los casos bajo ataques adaptativos. Los enfoques que funcionan —Dual-LLM, CaMeL y la regla de los dos meta— construyen aislamiento en lugar de intentar distinguir el bien del mal.
La inyección de instrucciones es una vulnerabilidad en la que texto no confiable (por ejemplo, de una página web o de un correo electrónico) se introduce en el contexto de un modelo de lenguaje grande (LLM, por sus siglas en inglés) y comienza a ejecutarse como una instrucción, lo que provoca el robo de datos o acciones no autorizadas. Esto no es un jailbreak: el atacante es otra persona, y la víctima es el usuario que simplemente pidió procesar el contenido. Las protecciones clásicas —un mensaje del sistema que dice «ignora instrucciones ajenas» y clasificadores en la entrada— no funcionan debido a la infinita variedad de ataques y la no determinación de los modelos. El estudio «The Attacker Moves Second» (2025) mostró que 12 defensas publicadas se vulneran en más del 90% de los casos ante ataques adaptativos; una sesión en vivo de red team las vulneró todas al 100%. La vulnerabilidad se explica por el «trío mortal»: datos privados + contenido no confiable + canal de salida. Un ejemplo es EchoLeak (CVE-2025-32711) contra Microsoft 365 Copilot: un exploit de clic cero a través de un correo electrónico sorteaba clasificadores, filtros de enlaces, política de seguridad de contenido (CSP, por sus siglas en inglés) y generación aumentada por recuperación (RAG, por sus siglas en inglés). Meta propuso la «regla de los dos»: un agente no debe tener acceso simultáneo a datos, procesar entradas no confiables y cambiar el estado o comunicarse con el mundo exterior. El patrón de LLM dual divide las funciones entre dos modelos: el privilegiado (con herramientas) no ve el texto no confiable, el aislado (con el texto) no tiene herramientas; el código controlador solo pasa variables simbólicas. Google DeepMind propuso CaMeL (Confidential Multi-Agent LLM), un sistema con cifrado a nivel de control de acceso basado en roles (RBAC, por sus siglas en inglés), donde cada agente tiene solo los roles necesarios y los datos no confiables se etiquetan y no son visibles para los agentes privilegiados. En 2025, se publicaron seis patrones de diseño que sistematizan el aislamiento según la tarea. Se analiza una implementación funcional con tres modelos que no se ven entre sí, con comprobaciones deterministas, usando el ejemplo de un generador de preguntas frecuentes que lee una página ajena pero no obedece sus instrucciones.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas