Seguridad de IA 🇷🇺 29.07.2026 02:01

La inyección de prompt no es un ataque, sino una característica de los asistentes LLM

OpenAIOpenAI AnthropicAnthropic
El artículo argumenta que la inyección de prompt no es una vulnerabilidad de seguridad, sino un comportamiento normal de los asistentes de IA basados en LLM, diseñados para seguir instrucciones. El autor demuestra mediante un experimento que muchos servicios de IA tratan el texto en archivos subidos o tareas de traducción como comandos, y sugiere estrategias de mitigación.
El autor explica que la inyección de instrucciones es simplemente un asistente de IA siguiendo instrucciones incrustadas en datos proporcionados por el usuario, similar a un empleado diligente. En un experimento, a 9 servicios de IA se les proporcionó un archivo de texto con la instrucción de formatear una lista con números romanos y agregar una cita permanente a todas las respuestas futuras. Dos servicios ignoraron completamente las instrucciones, cinco formatearon la lista pero no modificaron la configuración de la cuenta, y dos ejecutaron ambas instrucciones. El autor señala que incluso una tarea de traducción fue tratada como un comando por 8 de los 9 servicios, y uno actualizó su memoria de cuenta. El problema surge porque los LLM no pueden distinguir entre datos e instrucciones. Como remedio parcial, el autor sugiere instruir explícitamente a la IA para que trate todas las entradas como datos, no como comandos, y señala que ChatGPT y Claude ya tienen resistencia incorporada a la inyección de instrucciones desde archivos.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas