Keamanan AI 🇺🇸 29.07.2026 22:02

Beberapa Model AI Frontier Sangat Mudah Dijailbreak, Laporan Temukan

AnthropicAnthropic OpenAIOpenAI Google/DeepMindGoogle/DeepMind
Sebuah laporan baru dari FAR.AI mengungkapkan bahwa beberapa model AI terkemuka dapat dijailbreak dengan biaya atau usaha yang sedikit. Grok adalah yang paling rentan, sementara Claude dan GPT tetap kebal terhadap serangan yang diuji. Temuan ini menekankan perlunya regulasi keselamatan eksternal.
FAR.AI, sebuah organisasi nirlaba yang bergerak di bidang keselamatan AI, membangun alat yang menghasilkan ribuan variasi prompt untuk menerobos celah keamanan model AI terdepan. Mereka menguji model dari perusahaan AS: Claude Opus 4.8 dan Fable 5 milik Anthropic; GPT 5.5 dan 5.6 milik OpenAI; Gemini 3.1 Pro milik Google; serta Grok 4.3 dan 4.5 dari SpaceXAI. Laporan tersebut menemukan 448 celah keamanan pada Grok, 249 pada Gemini, dan tidak ada sama sekali pada Claude, Fable, atau GPT. Biaya untuk menerobos Grok adalah 58 dolar AS, sementara Gemini sebesar 278 dolar AS. CEO FAR.AI, Adam Gleave, menyerukan adanya standar keselamatan yang wajib dipatuhi, dengan alasan bahwa komitmen sukarela tidaklah cukup. Rohin Shah dari Google DeepMind berpendapat bahwa hasil tersebut bukanlah penilaian keselamatan yang komprehensif. Anthropic dan Google menekankan adanya perbaikan yang berkelanjutan. California, New York, dan Illinois telah mengesahkan undang-undang yang mewajibkan laporan keselamatan atau audit pihak ketiga, tetapi belum ada persyaratan di tingkat federal. Gedung Putih telah meminta penundaan perilisan beberapa model. Para pakar memperingatkan potensi penyalahgunaan di bidang siber, biologi, atau kimia.
Sumber: Wired AI — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru