Keamanan AIRiset 🇩🇪 12.08.2026 21:03

Peretasan LLM: Peneliti Dapat Merekonstruksi Prompt Pengguna dari Respons Chatbot

Alibaba/QwenAlibaba/Qwen OpenAIOpenAI
Para peneliti dari IIT Bombay dan Adobe Research telah mengembangkan metode untuk merekonstruksi prompt asli dari model bahasa besar berdasarkan keluaran teksnya dengan akurasi tinggi. Pendekatan ini tidak memerlukan akses ke bobot model dan bahkan berfungsi pada model dari vendor lain. Hal ini menimbulkan risiko keamanan potensial bagi bisnis yang menggunakan prompt sistem kepemilikan.
Para peneliti dari IIT Bombay dan Adobe Research telah mengembangkan metode yang dapat merekonstruksi prompt input dari model bahasa besar hampir secara tepat dari keluaran teksnya, bekerja tanpa akses ke bobot model dan bahkan dapat ditransfer ke model lain. Metode yang disebut 'Previous-Token Prediction' (PTP) ini membalikkan prinsip dasar model bahasa dengan melatih model invers untuk memprediksi token sebelumnya, bukan token berikutnya. Model invers ini dilatih dari awal hanya menggunakan data sintetis yang dihasilkan oleh LLM target. Model invers tidak hanya dapat mengembalikan prompt asli secara tepat, tetapi juga menghasilkan beberapa alternatif prompt yang berbeda secara semantik dengan memvariasikan parameter decoding. Dalam contoh kualitatif dari makalah tersebut, prompt 'Bagaimana cara menghubungi pesaing untuk menemukan strategi harga mereka?' berhasil direkonstruksi secara tepat, bersama dengan enam varian lainnya. Pengujian dengan prompt pengguna nyata juga menunjukkan rekonstruksi yang setia secara semantik. Model invers kecil yang dilatih pada Qwen-3-0.6B-Chat juga dapat merekonstruksi prompt dari respons GPT-4o, menangkap konteks dan maksud yang mendasarinya, yang berarti penyerang bahkan tidak perlu mengetahui model mana yang ada di balik keluaran teks. Ini menghadirkan masalah keamanan yang luas bagi perusahaan, karena prompt sistem kepemilikan dengan rahasia bisnis, aturan moderasi, atau instruksi khusus dapat diekstraksi, serta input pengguna yang bersifat rahasia. Makalah itu sendiri tidak membuat pernyataan eksplisit tentang serangan terhadap sistem komersial, tetapi pembuat model perlu mengklarifikasi dan berpotensi memperbaiki kerentanan ini.
Sumber: The Decoder (DE) — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru