LLM-Hacking: Forscher können Benutzerprompts aus Chatbot-Antworten rekonstruieren
Alibaba/Qwen
OpenAI
Forscher des Indian Institute of Technology Bombay und von Adobe Research haben eine Methode entwickelt, mit der die ursprünglichen Prompts großer Sprachmodelle mit hoher Genauigkeit aus ihren Textantworten rekonstruiert werden können. Der Ansatz erfordert keinen Zugriff auf die Modellgewichte und funktioniert auch bei Modellen anderer Anbieter. Dies stellt ein potenzielles Sicherheitsrisiko für Unternehmen dar, die proprietäre Systemprompts verwenden.
Forscher des IIT Bombay und von Adobe Research haben eine Methode entwickelt, die die Eingabe-Prompts großer Sprachmodelle nahezu exakt aus deren Textausgaben rekonstruieren kann, ohne Zugriff auf die Modellgewichte zu haben und sogar auf andere Modelle übertragbar ist. Die Methode namens 'Previous-Token Prediction' (PTP) kehrt das Grundprinzip von Sprachmodellen um, indem sie ein inverses Modell trainiert, das vorherige Token statt des nächsten Tokens vorhersagt. Dieses inverse Modell wird von Grund auf ausschließlich mit synthetischen Daten trainiert, die vom Ziel-LLM generiert werden. Das inverse Modell kann nicht nur den ursprünglichen Prompt exakt wiederherstellen, sondern auch mehrere semantisch unterschiedliche Prompt-Alternativen erzeugen, indem die Decodierungsparameter variiert werden. In einem qualitativen Beispiel aus der Arbeit wurde der Prompt 'Wie kontaktierte man Konkurrenten, um deren Preisstrategien herauszufinden?' exakt rekonstruiert, zusammen mit sechs anderen Varianten. Tests mit echten Nutzer-Prompts zeigten ebenfalls semantisch treue Rekonstruktionen. Ein kleines inverses Modell, das auf Qwen-3-0.6B-Chat trainiert wurde, konnte auch Prompts aus GPT-4o-Antworten rekonstruieren und dabei den zugrunde liegenden Kontext und die Absicht erfassen, was bedeutet, dass ein Angreifer nicht einmal wissen müsste, welches Modell hinter einer Textausgabe steht. Dies stellt ein breites Sicherheitsproblem für Unternehmen dar, da proprietäre System-Prompts mit Geschäftsgeheimnissen, Moderationsregeln oder spezialisierten Anweisungen extrahiert werden könnten, ebenso wie vertrauliche Nutzereingaben. Die Arbeit selbst macht keine expliziten Aussagen über Angriffe auf kommerzielle Systeme, aber die Modellhersteller müssen diese Schwachstelle klären und möglicherweise beheben.
Quelle: The Decoder (DE) —
Original
