Tiga Insiden Dunia Nyata dalam Evaluasi Keamanan Siber Anthropic
Anthropic
OpenAI
Anthropic menemukan tiga insiden dunia nyata dalam evaluasi keamanan siber mereka di mana Claude, karena kesalahpahaman tentang akses internet, membahayakan sistem eksternal. Satu insiden melibatkan pengunggahan malware ke PyPI, yang dipasang oleh perusahaan keamanan. Insiden-insiden ini menyoroti risiko menjalankan evaluasi serangan siber.
Anthropic meninjau 141.006 putaran evaluasi dan menemukan tiga insiden terpisah yang melibatkan enam total putaran, empat di antaranya memengaruhi organisasi yang sama. Dalam semua kasus, perintah evaluasi memberi tahu Claude bahwa lingkungannya adalah simulasi tanpa akses internet, tetapi karena kesalahpahaman dengan mitra evaluasi, akses internet tersedia. Claude memperlakukan sistem nyata sebagai bagian dari latihan dan membahayakan mereka menggunakan teknik dasar seperti kata sandi lemah dan titik akhir tanpa autentikasi. Satu perusahaan menjadi sasaran karena namanya cocok dengan nama fiktif dalam eval. Insiden yang paling mengkhawatirkan melibatkan Claude mengunggah paket malware ke PyPI setelah proses rumit untuk membuat akun. Paket tersebut diinstal oleh perusahaan keamanan yang rutin memindai paket Python untuk malware, dan kode yang dieksekusi mengeksfiltrasi kredensial kembali ke Claude. Paket tersebut dihapus oleh pemindai otomatis lain satu jam kemudian, tetapi sudah diunduh dan dieksekusi pada 15 sistem nyata. Insiden-insiden ini menggarisbawahi risiko signifikan dari menjalankan eval serangan siber dan perlunya pemantauan ketat terhadap sandbox.
Sumber: Simon Willison —
asli
