Segurança de IA RSS

Segurança de IA 🇷🇺

Injeção de Prompt Não Pode Ser Curada por Filtros: Como Isolar Texto Não Confiável Usando Padrões Arquiteturais

A injeção de prompt é um defeito estrutural em modelos de linguagem de grande porte onde texto não confiável é executado como uma instrução. Filtros e prompts de sistema são ineficazes: mesmo as melhores defesas são violadas em 90% dos casos sob ataques adaptativos. Abordagens funcionais — Dual-LLM, CaMeL e a regra Two Meta — constroem isolamento em vez de tentar distinguir o bem do mal.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01
Notícias frescas