Keamanan AI 🇷🇺 10.08.2026 12:03

Sisi Gelap LLM: Bagaimana dan Mengapa Mereka Diubah Menjadi Senjata (dan Apa yang Harus Dilakukan)

DeepSeekDeepSeek OpenAIOpenAI AnthropicAnthropic Google/DeepMindGoogle/DeepMind MetaMeta LakeraLakera
Model Bahasa Besar (LLM) rentan terhadap serangan jailbreak yang melewati mekanisme keamanannya, sehingga memungkinkan mereka menghasilkan konten berbahaya seperti instruksi untuk kejahatan. Aktor ancaman juga menggunakan LLM black-hat khusus untuk kejahatan siber. Pertahanan mencakup penyaringan berlapis, pelatihan adversarial, dan pengumpulan data serangan dari kerumunan melalui proyek seperti Gandalf.
Jailbreaking adalah jenis injeksi prompt di mana penyerang memberikan peran pada LLM yang mengesampingkan pelatihan keselamatannya. Misalnya, sebuah prompt bernama SWILL dibagikan di forum-forum, membuat DeepSeek percaya bahwa ia adalah model yang berbeda tanpa sensor, setelah itu ia dengan mudah memberikan saran tentang cara menghancurkan sidik jari dan memalsukan mata uang, meskipun ia masih menolak untuk membahas insiden Lapangan Tiananmen. Jailbreak berhasil karena keselamatan LLM bukanlah modul terpisah melainkan bagian dari perilaku yang dipelajari model; jailbreak menciptakan sinyal kontekstual yang kuat yang menggeser distribusi probabilitas ke arah keluaran yang berbahaya. Di luar jailbreak, ada LLM black-hat khusus seperti WormGPT, EvilGPT, WolfGPT, dan DarkBERT yang dilatih secara khusus untuk kejahatan siber, meskipun banyak yang sudah tidak aktif atau merupakan penipuan. Pertahanan termasuk pemisahan arsitektural antara prompt sistem dan pengguna, filter input/output seperti AVI (Antarmuka Validasi Alignment/Kesepakatan) atau Llama Guard, fine-tuning adversarial, penyelarasan AI konstitusional, analisis aktivasi internal, perlindungan berbasis RAG, dan red teaming. Untuk mengumpulkan data waktu nyata tentang teknik jailbreak, Lakera meluncurkan proyek Gandalf, sebuah permainan interaktif di mana peserta meretas aplikasi AI simulasi untuk mengekstrak rahasia atau memaksa perilaku berbahaya, dengan papan peringkat untuk meningkatkan keterlibatan.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru