Keamanan AIAgen 🇨🇳 10.08.2026 09:01

Claude Code Beralih ke Mode Otomatis secara Default dalam 5 Hari, Anthropic Menanggung Biaya Tambahan

AnthropicAnthropic OpenAIOpenAI
Anthropic akan menjadikan mode otomatis sebagai default untuk Claude Code dalam lima hari, dengan alasan rendahnya tingkat penolakan persetujuan izin manual dan kinerja keamanan pengklasifikasi yang lebih baik. Biaya token tambahan per panggilan alat dalam mode otomatis tidak akan dibebankan kepada pengguna. Platform cloud seperti Amazon, Google, dan Microsoft memiliki waktu satu bulan untuk beralih ke mode otomatis secara default.
Anthropic akan mengaktifkan mode otomatis sebagai default untuk semua instalasi Claude Code dalam lima hari, setelah menemukan bahwa hanya 3% permintaan izin yang ditolak oleh pengguna. Klasifikasi mode otomatis mengonsumsi sejumlah kecil token tambahan per panggilan alat, tetapi Anthropic tidak akan membebankan biaya ini kepada pengguna. Platform cloud seperti Amazon, Google, dan Microsoft, yang saat ini menawarkan mode otomatis sebagai opsi, harus beralih ke mode otomatis default dalam waktu satu bulan. Tim internal Anthropic sudah menggunakan mode otomatis secara eksklusif, menurut 'bapak Claude Code'. Anthropic membenarkan perubahan ini dengan data: persetujuan manual telah menjadi kebiasaan, dengan tingkat penerimaan 97% untuk prompt izin, sementara tingkat penolakan untuk permintaan izin tunggal hanya 3%. Dalam eksperimen terkontrol dengan 1053 penguji berbayar, peserta manusia mencegat perintah yang jelas berbahaya 13,6% dari waktu, sementara mode otomatis mencegatnya 89% dari waktu; mode otomatis memblokir 800 perintah yang diizinkan manusia, sementara manusia hanya memblokir 6 perintah yang diizinkan mode otomatis. Kinerja manusia menurun seiring panjang sesi, turun dari sekitar 17% di awal menjadi sekitar 5% setelah 50 prompt, sedangkan tingkat intersepsi mode otomatis tetap konstan. Data produksi yang dinilai ulang pada skala keparahan 0 hingga 10 menunjukkan bahwa pada keparahan 7 ke atas, 6,3% sesi yang disetujui secara manual melibatkan tindakan berbahaya yang tidak diminta secara eksplisit oleh pengguna, dibandingkan dengan 2,4% untuk mode otomatis. Klasifier diuji secara adversial dengan Apollo Research, yang menyuntikkan serangan sintetis ke dalam jejak kode nyata; setelah pengerasan, mode otomatis memulihkan sekitar setengah dari serangan yang sebelumnya terlewat, dengan tingkat kesalahan turun dari 12% menjadi 7% pada gabungan dataset. Dalam uji injeksi prompt oleh Trajectory Labs, Claude Fable 5, Opus 5, dan Sonnet 5 yang menjalankan mode otomatis tidak dikompromikan dalam 720 percobaan, sementara GPT-5.6 Sol dalam mode Codex Auto-review memiliki tingkat keberhasilan 5,83% dan 19,03% dalam mode Full Access. Tiga kasus intersepsi publik termasuk memblokir rencana untuk mempublikasikan laporan di situs berbagi kode publik, memblokir penghentian massal proses di 2000 pod, dan menandai peran cloud dengan izin admin penuh. Kemampuan baru termasuk penolakan keras terhadap eksfiltrasi data, diferensiasi akses kunci dan informasi sensitif, pemeriksaan status git sebelum perintah seperti git reset --hard, dan pemeriksaan sisi API untuk percobaan injeksi. Pengguna dapat beralih mode dengan Shift+Tab di CLI atau dropdown mode di desktop; administrator dapat menetapkan default tingkat organisasi atau menonaktifkan mode otomatis sepenuhnya. Anthropic mencatat bahwa mode otomatis mengurangi tetapi tidak menghilangkan risiko, dan merekomendasikan peninjauan perubahan berisiko tinggi.
Sumber: QbitAI 量子位 — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru