Bagaimana Saya Mengubah AI ke Sisi Gelap: Kerentanan Sistemik pada LLM Terkemuka
OpenAI
Anthropic
DeepSeek
Google/DeepMind
Meta
Microsoft
Mistral
xAI
Peneliti Dave Kuszmar menemukan beberapa kerentanan sistemik pada LLM utama, yang memungkinkannya melewati langkah-langkah keamanan dan memperoleh instruksi berbahaya. Eksploitasi ini berhasil di hampir semua LLM utama, mengungkapkan masalah keamanan di seluruh industri. Kuszmar menyerukan perlambatan penerapan, peningkatan transparansi, dan penelitian skala besar tentang keamanan LLM.
Peneliti Dave Kuszmar, mantan direktur keamanan siber, menemukan bahwa ia dapat melewati batasan keamanan pada model bahasa besar (LLM) terkemuka menggunakan teknik seperti Time Bandit dan Inception. Time Bandit mengeksploitasi ketidaktahuan LLM terhadap waktu saat ini untuk membuatnya beroperasi di bawah hukum yang sudah usang, sementara Inception menggunakan skenario bersarang untuk menipu model agar menghasilkan keluaran berbahaya. Eksploitasi ini berhasil pada model termasuk GPT-4o milik OpenAI, Claude milik Anthropic, DeepSeek, Gemini milik Google, Llama milik Meta, Copilot milik Microsoft, Le Chat milik Mistral, dan Grok milik xAI. Kuszmar berhasil mendapatkan petunjuk pembuatan napalm, methamphetamine, dan bahkan fasilitas pengayaan uranium untuk senjata nuklir. Meskipun melaporkan kerentanan ini ke OpenAI, CIA, FBI, dan lembaga lainnya, ia menerima sedikit tanggapan. Kerentanan tersebut akhirnya diverifikasi oleh Bleeping Computer dan dilaporkan ke Computer Emergency Response Team (CERT) dari Software Engineering Institute, Carnegie Mellon University.
Sumber: IEEE Spectrum AI —
asli
