Segurança de IAModelos 🇷🇺 24.07.2026 11:01

Injeção de Prompt Não é Curada por Filtros: Como Isolar Texto Não Confiável Usando Padrões Arquiteturais

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
A injeção de prompt continua sendo uma falha estrutural em aplicações de LLM, não resolvida por prompts de sistema ou classificadores. Padrões arquiteturais como Dual-LLM, CaMeL do Google DeepMind e a Regra dos Dois Agentes da Meta fornecem isolamento robusto. O artigo detalha o modelo de ameaça, a vulnerabilidade EchoLeak no Microsoft 365 Copilot e uma implementação concreta com três modelos isolados.
Injeção de prompt, introduzida por Simon Willison em setembro de 2022, ocorre quando texto não confiável no contexto de um LLM (modelo de linguagem de grande porte) é executado como uma instrução. Diferentemente do jailbreak, isso afeta aplicações onde o modelo tem acesso a ferramentas e dados, levando a ataques de confusão de deputado e exfiltração de dados. O artigo argumenta que prompts de sistema e classificadores de barreira são ineficazes, citando um estudo de 2025 da OpenAI, Anthropic e Google DeepMind que mostrou que ataques adaptativos contornam 12 defesas publicadas com mais de 90% de sucesso. O 'triplo letal' de Simon Willison identifica três ingredientes para exfiltração de dados: acesso a dados privados, contato com conteúdo não confiável e um canal de saída. A vulnerabilidade EchoLeak (CVE-2025-32711) no Microsoft 365 Copilot explorou todos os três. A 'Regra dos Dois para Agentes' da Meta afirma que um agente não deve ter mais de duas das três propriedades: processar entrada não confiável, acesso a sistemas/dados sensíveis e capacidade de alterar estado ou comunicar externamente. Arquiteturas como Dual-LLM (Willison, 2023) separam um LLM privilegiado (com ferramentas, vendo apenas entrada confiável) de um LLM em quarentena (sem ferramentas, tratando texto não confiável), conectados por um controlador determinístico. O CaMeL do Google DeepMind (2024) usa um verificador para garantir que o modelo em quarentena produza apenas um subconjunto estrito de tokens permitidos. Seis padrões de projeto de um artigo de 2025 estendem essa ideia. Uma implementação concreta é descrita usando três modelos isolados para um gerador de FAQ: um privilegiado com acesso a dados e ferramentas da empresa, um em quarentena para texto de página não confiável e um para síntese, com verificações determinísticas entre eles.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas