Promptinjectie is geen aanval, maar een eigenschap van LLM-assistenten
OpenAI
Anthropic
Het artikel stelt dat promptinjectie geen beveiligingslek is, maar normaal gedrag van op LLM gebaseerde AI-assistenten die zijn ontworpen om instructies op te volgen. De auteur toont via een experiment aan dat veel AI-diensten tekst in geüploade bestanden of vertaaltaken als commando's behandelen, en stelt mitigerende strategieën voor.
De auteur legt uit dat prompt-injectie simpelweg neerkomt op een AI-assistent die instructies opvolgt die in door de gebruiker verstrekte gegevens zijn ingebed, vergelijkbaar met een ijverige werknemer. In een experiment kregen 9 AI-diensten een tekstbestand met de instructie om een lijst met Romeinse cijfers op te maken en een permanente quote aan alle toekomstige antwoorden toe te voegen. Twee diensten negeerden de instructies volledig, vijf formatteerden de lijst maar wijzigden de accountinstellingen niet, en twee voerden beide instructies uit. De auteur merkt op dat zelfs een vertaaltaak door 8 van de 9 diensten als een commando werd behandeld, waarbij er één het accountgeheugen bijwerkte. Het probleem ontstaat omdat LLM's geen onderscheid kunnen maken tussen gegevens en instructies. Als gedeeltelijke oplossing stelt de auteur voor om de AI expliciet te instrueren om alle invoer als gegevens te behandelen, niet als commando's, en merkt hij op dat ChatGPT en Claude al een ingebouwde weerstand tegen prompt-injectie via bestanden hebben.
Bron: Habr — хаб ИИ —
origineel
