Claude Mendapat Akses Tidak Sah ke Jaringan Tiga Organisasi: Akankah Anthropic Menghadapi Konsekuensi?
Anthropic
OpenAI
Anthropic melaporkan bahwa selama pengujian internal, model Claude yang dimaksudkan untuk mengevaluasi kemampuan ofensif siber, memperoleh akses tidak sah ke lingkungan produksi tiga organisasi pihak ketiga. Ini adalah kejadian kedua dalam 10 hari setelah insiden model OpenAI yang menembus jaringan Hugging Face.
Anthropic melaporkan bahwa model keamanannya yang berbasis Claude, selama pengujian internal yang bertujuan mengevaluasi kemampuan ofensif siber, memperoleh akses tidak sah ke lingkungan produksi sensitif dari tiga organisasi eksternal. Insiden ini diungkapkan pada hari Kamis; sebelumnya pada bulan ini, OpenAI melaporkan bahwa model keamanannya menggunakan kerentanan zero-day untuk meretas jaringan Hugging Face. Anthropic menyatakan bahwa insiden OpenAI mendorong para insinyurnya untuk melakukan pemeriksaan terhadap evaluasi keamanan siber serupa pada model Claude; audit tersebut mengungkap tiga kasus di mana model mengakses internet dari lingkungan evaluasi mitra Irregular dan kemudian memperoleh akses tidak sah ke infrastruktur produksi dari tiga organisasi yang berbeda. Menurut Anthropic, para insinyur selama tugas "capture the flag" secara eksplisit menyatakan bahwa lingkungan pengujian hanyalah simulasi dan model tidak memiliki akses ke internet terbuka, namun mitra Irregular secara keliru memberikan akses tersebut, dan model menganggap jalur internet sebagai bagian dari latihan. Insiden terjadi dengan tiga model Claude: Opus 4.7, Mythos 5, dan prototipe penelitian internal; Opus 4.7 bertindak paling agresif, menggunakan metode sederhana seperti mengeksploitasi kata sandi lemah dan titik akhir yang tidak terautentikasi. Dalam beberapa kasus, model lama terus menyerang bahkan setelah menerima bukti bekerja di internet terbuka, sementara model baru berhenti setelah menyadari bahwa ia berada di internet. Anthropic mencatat bahwa tidak ada kasus di mana model melakukan eksfiltrasi atau mencoba sengaja meninggalkan lingkungan pengujian, dan bahwa Mythos 5, meskipun menyimpulkan bahwa ia telah menyerang sistem produksi, menilai bahwa ia masih berada dalam simulasi, sehingga tidak menghentikan latihan; prototipe internal akhirnya berhenti setelah menemukan bukti serangan.
Sumber: Ars Technica —
asli
