Seguridad de IAInvestigación 🇺🇸 27.07.2026 17:06

StruQ y SecAlign: Defensa contra ataques de inyección de instrucciones

MetaMeta OpenAIOpenAI
Investigadores de BAIR proponen dos defensas de ajuste fino, StruQ y SecAlign, contra ataques de inyección de instrucciones en aplicaciones integradas con LLM. StruQ utiliza ajuste de instrucciones estructuradas para ignorar instrucciones inyectadas, mientras que SecAlign aplica optimización de preferencias para lograr una mejor robustez, reduciendo las tasas de éxito de ataque a casi 0% para ataques sin optimización y por debajo del 15% para ataques basados en optimización.
La inyección de indicaciones, donde datos no confiables contienen una instrucción que anula la indicación prevista del sistema, está clasificada como la amenaza número 1 por OWASP para aplicaciones integradas con LLM. Se ha demostrado que sistemas de nivel de producción como Google Docs, Slack AI y ChatGPT son vulnerables. Los autores proponen dos causas: la falta de separación entre la indicación y los datos, y el hecho de que los LLM están entrenados para seguir instrucciones en cualquier parte de la entrada. Para abordar esto, presentan un Front-End Seguro que utiliza tokens especiales para delimitar la indicación y los datos, filtrando cualquier delimitador en los datos. StruQ (Ajuste de Instrucción Estructurado) simula inyecciones de indicaciones durante el entrenamiento, enseñando al LLM a ignorar instrucciones inyectadas en la parte de datos. SecAlign (Optimización de Preferencia Especial) va más allá al entrenar tanto con respuestas deseables como indeseables, utilizando optimización de preferencia para crear una gran brecha de probabilidad entre ellas. Los experimentos en Llama3-8B-Instruct muestran que StruQ reduce la Tasa de Éxito de Ataque (ASR, por sus siglas en inglés) al 45%, y SecAlign la reduce aún más al 8% frente a ataques sofisticados. SecAlign preserva la utilidad medida por AlpacaEval2, mientras que StruQ la disminuye en un 4.5%. Ambos reducen las tasas de éxito de ataques sin optimización a casi el 0%, y SecAlign reduce la ASR de ataques basados en optimización en un factor de más de 4 en comparación con el estado del arte anterior.
Fuente: BAIR (Berkeley AI) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas