La inyección de instrucciones no se cura con filtros: cómo aislar texto no confiable usando patrones arquitectónicos
La inyección de instrucciones es un defecto estructural en los modelos de lenguaje grandes donde el texto no confiable se ejecuta como una instrucción. Los filtros y las instrucciones del sistema son ineficaces: incluso las mejores defensas son vulneradas en el 90% de los casos bajo ataques adaptativos. Los enfoques que funcionan —Dual-LLM, CaMeL y la regla de los dos meta— construyen aislamiento en lugar de intentar distinguir el bien del mal.
OpenAI
Anthropic
Google DeepMind
Microsoft
Habr — хаб ИИ24.07 · 11:01
