AI-veiligheidModellen 🇷🇺 24.07.2026 11:01

Prompt-injectie wordt niet opgelost door filters: hoe u onvertrouwde tekst isoleert met architectuurpatronen

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Prompt-injectie blijft een structurele fout in LLM-toepassingen, die niet wordt verholpen door systeemprompts of classificatoren. Architectuurpatronen zoals Dual-LLM, CaMeL van Google DeepMind en de Agents Rule of Two van Meta bieden robuuste isolatie. Het artikel beschrijft het dreigingsmodel, de EchoLeak-kwetsbaarheid in Microsoft 365 Copilot en een concrete implementatie met drie geïsoleerde modellen.
Prompt-injectie, geïntroduceerd door Simon Willison in september 2022, treedt op wanneer onvertrouwde tekst in de context van een groot taalmodel als instructie wordt uitgevoerd. In tegenstelling tot jailbreaken, beïnvloedt het applicaties waarbij het model toegang heeft tot hulpmiddelen en gegevens, wat leidt tot 'confused deputy'-aanvallen en datalekkage. Het artikel stelt dat systeemprompts en 'guardrail'-classificatoren ineffectief zijn, verwijzend naar een studie uit 2025 van OpenAI, Anthropic en Google DeepMind, waarin adaptieve aanvallen 12 gepubliceerde verdedigingen met meer dan 90% succes omzeilden. Simon Willison's 'dodelijke triade' identificeert drie ingrediënten voor datalekkage: toegang tot privégegevens, contact met onvertrouwde inhoud en een uitgaand kanaal. De EchoLeak-kwetsbaarheid (CVE-2025-32711) in Microsoft 365 Copilot maakte misbruik van alle drie. Meta's 'Agents Rule of Two' stelt dat een agent niet meer dan twee van drie eigenschappen mag hebben: het verwerken van onvertrouwde invoer, toegang tot gevoelige systemen/gegevens, en de mogelijkheid om de status te wijzigen of extern te communiceren. Architecturen zoals Dual-LLM (Willison, 2023) scheiden een geprivilegieerd groot taalmodel (met hulpmiddelen, ziet alleen vertrouwde invoer) van een afgezonderd groot taalmodel (zonder hulpmiddelen, verwerkt onvertrouwde tekst), verbonden door een deterministische controller. Google DeepMind's CaMeL (2024) gebruikt een verificateur om af te dwingen dat het afgezonderde model alleen een strikte subset van toegestane tokens uitvoert. Zes projectpatronen uit een paper uit 2025 breiden dit idee uit. Een concrete implementatie wordt beschreven met drie geïsoleerde modellen voor een 'FAQ-'generator: één geprivilegieerd met toegang tot bedrijfsgegevens en hulpmiddelen, één afgezonderd voor onvertrouwde paginatekst, en één voor synthese, met deterministische controles ertussen.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws