Keamanan AIModel 🇷🇺 24.07.2026 11:01

Injeksi Prompt Tidak Disembuhkan oleh Filter: Cara Mengisolasi Teks Tidak Tepercaya dengan Pola Arsitektural

OpenAIOpenAI AnthropicAnthropic Google DeepMindGoogle DeepMind MicrosoftMicrosoft
Injeksi prompt tetap menjadi cacat struktural dalam aplikasi LLM, tidak diperbaiki oleh prompt sistem atau pengklasifikasi. Pola arsitektural seperti Dual-LLM, CaMeL dari Google DeepMind, dan Aturan Dua dari Meta memberikan isolasi yang kokoh. Artikel ini merinci model ancaman, kerentanan EchoLeak di Microsoft 365 Copilot, dan implementasi konkret dengan tiga model terisolasi.
Injeksi prompt, yang diperkenalkan oleh Simon Willison pada September 2022, terjadi ketika teks yang tidak tepercaya dalam konteks LLM (Large Language Model) dieksekusi sebagai instruksi. Tidak seperti jailbreaking, ini memengaruhi aplikasi tempat model memiliki akses ke alat dan data, yang menyebabkan serangan deputi bingung (confused deputy) dan eksfiltrasi data. Artikel tersebut berpendapat bahwa prompt sistem dan pengklasifikasi pagar pengaman (guardrail classifiers) tidak efektif, mengutip studi tahun 2025 oleh OpenAI, Anthropic, dan Google DeepMind yang menunjukkan bahwa serangan adaptif berhasil melewati 12 pertahanan yang dipublikasikan dengan tingkat keberhasilan lebih dari 90%. 'Trinitas mematikan' (lethal trifecta) Simon Willison mengidentifikasi tiga bahan untuk eksfiltrasi data: akses ke data pribadi, kontak dengan konten yang tidak tepercaya, dan saluran keluar. Kerentanan EchoLeak (CVE-2025-32711) di Microsoft 365 Copilot mengeksploitasi ketiganya. 'Aturan Dua untuk Agen' (Agents Rule of Two) Meta menyatakan bahwa sebuah agen seharusnya tidak memiliki lebih dari dua dari tiga properti: memproses masukan yang tidak tepercaya, akses ke sistem/data sensitif, dan kemampuan untuk mengubah status atau berkomunikasi secara eksternal. Arsitektur seperti Dual-LLM (Willison, 2023) memisahkan LLM istimewa (dengan alat, hanya melihat masukan tepercaya) dari LLM yang dikarantina (tanpa alat, menangani teks yang tidak tepercaya), yang dihubungkan oleh pengontrol deterministik. CaMeL dari Google DeepMind (2024) menggunakan verifikator untuk memastikan bahwa model yang dikarantina hanya mengeluarkan subset ketat dari token yang diizinkan. Enam pola proyek dari makalah tahun 2025 memperluas ide ini. Implementasi konkret dijelaskan menggunakan tiga model terisolasi untuk generator FAQ: satu model istimewa dengan akses ke data dan alat perusahaan, satu model dikarantina untuk teks halaman yang tidak tepercaya, dan satu untuk sintesis, dengan pemeriksaan deterministik di antara mereka.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru