Injeção de prompt não é um ataque, mas uma característica dos assistentes LLM
OpenAI
Anthropic
O artigo argumenta que a injeção de prompt não é uma vulnerabilidade de segurança, mas um comportamento normal de assistentes de IA baseados em LLM, projetados para seguir instruções. O autor demonstra através de um experimento que muitos serviços de IA tratam texto em arquivos carregados ou tarefas de tradução como comandos, e sugere estratégias de mitigação.
O autor explica que a injeção de prompt é simplesmente um assistente de IA seguindo instruções incorporadas em dados fornecidos pelo usuário, de forma similar a um funcionário diligente. Em um experimento, 9 serviços de IA receberam um arquivo de texto com uma instrução para formatar uma lista com numerais romanos e adicionar uma citação permanente a todas as respostas futuras. Dois serviços ignoraram completamente as instruções, cinco formataram a lista mas não alteraram as configurações da conta, e dois executaram ambas as instruções. O autor observa que até mesmo uma tarefa de tradução foi tratada como um comando por 8 dos 9 serviços, com um deles atualizando sua memória de conta. O problema surge porque os LLMs não conseguem distinguir entre dados e instruções. Como remédio parcial, o autor sugere instruir explicitamente a IA a tratar todas as entradas como dados, e não comandos, e observa que ChatGPT e Claude já possuem resistência embutida à injeção de prompt a partir de arquivos.
Fonte: Habr — хаб ИИ —
original
