Seguridad de IA RSS

Seguridad de IA 🇷🇺

La inyección de instrucciones no se cura con filtros: cómo aislar texto no confiable usando patrones arquitectónicos

La inyección de instrucciones es un defecto estructural en los modelos de lenguaje grandes donde el texto no confiable se ejecuta como una instrucción. Los filtros y las instrucciones del sistema son ineficaces: incluso las mejores defensas son vulneradas en el 90% de los casos bajo ataques adaptativos. Los enfoques que funcionan —Dual-LLM, CaMeL y la regla de los dos meta— construyen aislamiento en lugar de intentar distinguir el bien del mal.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01
Noticias frescas