AI-veiligheidOnderzoek 🇩🇪 12.08.2026 21:03

LLM-hacken: onderzoekers kunnen gebruikersprompts reconstrueren uit chatbotreacties

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Onderzoekers van IIT Bombay en Adobe Research hebben een methode ontwikkeld waarmee ze de oorspronkelijke prompts van grote taalmodellen kunnen reconstrueren uit hun tekstuitvoer met hoge nauwkeurigheid. De aanpak vereist geen toegang tot modelgewichten en werkt zelfs op modellen van andere leveranciers. Dit vormt een potentieel beveiligingsrisico voor bedrijven die gebruikmaken van propriëtaire systeemprompts.
Onderzoekers van IIT Bombay en Adobe Research hebben een methode ontwikkeld die de invoerprompts van grote taalmodellen bijna exact kan reconstrueren op basis van hun tekstuitvoer, zonder toegang tot modelgewichten en zelfs overdraagbaar naar andere modellen. De methode, genaamd 'Previous-Token Prediction' (PTP), keert het basisprincipe van taalmodellen om door een invers model te trainen dat vorige tokens voorspelt in plaats van het volgende token. Dit inverse model wordt vanaf nul getraind, uitsluitend gebruikmakend van synthetische data die door het doeltaalmodel is gegenereerd. Het inverse model kan niet alleen de oorspronkelijke prompt exact herstellen, maar ook meerdere semantisch verschillende promptalternatieven genereren door de decodeerparameters te variëren. In een kwalitatief voorbeeld uit het artikel werd de prompt 'Hoe neem je contact op met concurrenten om hun prijsstrategieën te achterhalen?' exact gereconstrueerd, samen met zes andere varianten. Tests met echte gebruikersprompts toonden ook semantisch getrouwe reconstructies aan. Een klein invers model dat getraind was op Qwen-3-0.6B-Chat kon ook prompts reconstrueren uit antwoorden van GPT-4o, waarbij de onderliggende context en intentie werden vastgelegd. Dit betekent dat een aanvaller niet eens hoeft te weten welk model achter een tekstuitvoer zit. Dit vormt een breed beveiligingsprobleem voor bedrijven, aangezien propriëtaire systeemprompts met bedrijfsgeheimen, moderatieregels of gespecialiseerde instructies kunnen worden geëxtraheerd, evenals vertrouwelijke gebruikersinvoer. Het artikel zelf doet geen expliciete uitspraken over aanvallen op commerciële systemen, maar modelmakers moeten deze kwetsbaarheid verduidelijken en mogelijk verhelpen.
Bron: The Decoder (DE) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws