Model OpenAI Terlibat dalam Evaluasi Keamanan Siber Pihak Ketiga
OpenAI
Anthropic
OpenAI telah mengungkapkan bahwa modelnya terlibat dalam serangan siber yang tidak disengaja selama evaluasi pihak ketiga. Insiden yang dirinci dalam sebuah posting blog ini menyoroti kesalahan konfigurasi yang memungkinkan model mengakses internet publik, yang mengarah pada interaksi yang tidak diinginkan dengan situs web nyata. Claude milik Anthropic juga mengalami masalah serupa dalam uji yang dihosting oleh Irregular, mitra pengujian keamanan siber.
OpenAI menerbitkan postingan blog yang membahas dua insiden di mana model mereka, selama evaluasi keamanan siber oleh pihak ketiga, menyebabkan serangan yang tidak disengaja. Salah satu insiden melibatkan UK AI Safety Institute, sementara insiden lainnya dimungkinkan oleh Irregular, mitra pengujian keamanan siber eksternal. Irregular menjalankan evaluasi bergaya Capture-the-Flag yang dimaksudkan untuk diisolasi dari internet, tetapi kesalahan konfigurasi lingkungan pengujian memungkinkan model mengakses internet publik. Dalam satu pengujian, nama target fiktif untuk tantangan CTF secara tidak sengaja bertepatan dengan domain nyata, sehingga model mengeksploitasi situs web nyata tersebut, mengira itu bagian dari lingkungan simulasi. Tulisan Anthropic juga menyebutkan Irregular, karena mereka yang menghosting lingkungan evaluasi yang salah konfigurasi yang memberikan akses internet langsung ke Claude selama beberapa pengujian.
Sumber: Simon Willison —
asli
