GPT-Red: Sistem Red Teaming Otomatis OpenAI untuk Keamanan AI yang Terus Meningkat
OpenAI
OpenAI memperkenalkan GPT-Red, sebuah sistem red teaming otomatis yang menggunakan metode self-play untuk meningkatkan keamanan, keselarasan, dan ketahanan terhadap injeksi prompt pada model bahasa besar. Sistem ini memungkinkan model untuk secara otonom menghasilkan skenario serangan dan menyempurnakan diri berdasarkan skenario tersebut, meningkatkan ketahanannya tanpa campur tangan manusia secara terus-menerus.
OpenAI telah meluncurkan GPT-Red, sebuah sistem red teaming otomatis yang dirancang untuk meningkatkan keamanan, keselarasan, dan ketahanan kecerdasan buatan. Sistem ini menggunakan metode pembelajaran self-play, di mana model secara otonom menghasilkan prompt serangan dan skenario berbahaya, kemudian menyempurnakan dirinya sendiri berdasarkan hal tersebut untuk meningkatkan pertahanannya. Pendekatan ini memungkinkan peningkatan ketahanan model secara berkelanjutan tanpa harus melibatkan penguji manusia secara terus-menerus. GPT-Red sangat efektif dalam mendeteksi dan memitigasi kerentanan terhadap injeksi prompt, di mana penyerang mencoba melewati batasan model menggunakan kueri yang dirancang khusus. Sistem ini secara otomatis mengevaluasi hasil serangan dan menggunakannya untuk menyesuaikan perilaku model, sehingga proses peningkatan keamanan menjadi lebih skalabel dan efisien.
Sumber: OpenAI —
asli
