AI-veiligheid RSS

AI-veiligheid 🇷🇺

Prompt-injectie kan niet worden genezen door filters: hoe u onvertrouwde tekst isoleert met architectuurpatronen

Prompt-injectie is een structureel defect in grote taalmodellen waarbij onvertrouwde tekst als instructie wordt uitgevoerd. Filters en systeemprompts zijn niet effectief: zelfs de beste verdedigingen worden in 90% van de gevallen doorbroken bij adaptieve aanvallen. Werkende benaderingen—Dual-LLM, CaMeL en de Twee Meta-regel—bouwen isolatie op in plaats van te proberen goed van kwaad te onderscheiden.

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Habr — хаб ИИ24.07 · 11:01
Vers nieuws