AI-veiligheid 🇷🇺 29.07.2026 02:01

Prompt-injectie is geen aanval, maar een kenmerk van AI-assistenten op basis van grote taalmodellen

OpenAIOpenAI AnthropicAnthropic
Het artikel stelt dat prompt-injectie geen beveiligingskwetsbaarheid is, maar normaal gedrag van AI-assistenten die zijn ontworpen om instructies op te volgen. De auteur toont via een experiment aan dat veel AI-diensten tekst in geüploade bestanden of vertaaltaken als commando's behandelen, en stelt mitigatiestrategieën voor.
De auteur legt uit dat prompt-injectie simpelweg neerkomt op een AI-assistent die instructies opvolgt die in door de gebruiker verstrekte gegevens zijn ingebed, vergelijkbaar met een ijverige werknemer. In een experiment kregen 9 AI-diensten een tekstbestand met de instructie om een lijst met Romeinse cijfers op te maken en een permanente quote aan alle toekomstige antwoorden toe te voegen. Twee diensten negeerden de instructies volledig, vijf formatteerden de lijst maar wijzigden de accountinstellingen niet, en twee voerden beide instructies uit. De auteur merkt op dat zelfs een vertaaltaak door 8 van de 9 diensten als een commando werd behandeld, waarbij er één het accountgeheugen bijwerkte. Het probleem ontstaat omdat LLM's geen onderscheid kunnen maken tussen gegevens en instructies. Als gedeeltelijke oplossing stelt de auteur voor om de AI expliciet te instrueren om alle invoer als gegevens te behandelen, niet als commando's, en merkt hij op dat ChatGPT en Claude al een ingebouwde weerstand tegen prompt-injectie via bestanden hebben.
Bron: Habr — хаб ИИ — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws