Sangat Mudah untuk Menembus Keamanan Beberapa Model AI Frontier
xAI
Sebuah studi baru mengungkapkan bahwa banyak model AI frontier masih rentan terhadap teknik jailbreak sederhana. Para peneliti menemukan bahwa metode seperti merancang prompt dalam seni ASCII atau menggunakan encoding kompleks dapat melewati pagar pengaman, menimbulkan kekhawatiran tentang keamanan AI.
Para peneliti telah menunjukkan betapa mudahnya membobol beberapa model AI kelas atas, menggunakan teknik yang mengeksploitasi keterbatasan pelatihan mereka. Metode sederhana seperti merepresentasikan prompt sebagai seni ASCII atau menggunakan pengkodean kompleks dapat melewati mekanisme keamanan, menyebabkan model menghasilkan konten berbahaya atau yang tidak diizinkan. Studi ini menyoroti bahwa meskipun investasi signifikan dalam pelatihan keamanan, banyak model tetap rentan terhadap serangan teknologi rendah ini. Kerentanan ini menggarisbawahi tantangan berkelanjutan dalam memastikan keselarasan yang kuat dalam sistem AI.
Sumber: xAI Grok (GNews) —
asli
