Tác tửAn toàn AI 🇺🇸 09.08.2026 02:02

Chế độ tự động trở thành mặc định trong Claude Code cho các gói Pro, Max và Team

AnthropicAnthropic
Anthropic đang đưa chế độ tự động của Claude Code thành mặc định cho các phiên mới trong hầu hết các gói dịch vụ từ ngày 14 tháng 8. Công ty tuyên bố đã có những cải tiến an toàn đáng kể, dựa trên các đánh giá cho thấy chế độ tự động chặn 89% các hành động có hại mà con người thường chấp thuận. Tuy nhiên, vẫn cần sự xác minh độc lập, đặc biệt là đối với các cuộc tấn công chèn lệnh gián tiếp.
Anthropic tự tin vào chế độ tự động của Claude Code, đặt chế độ này làm mặc định cho các phiên mới trong các gói Pro, Max và Team bắt đầu từ ngày 14 tháng 8 năm 2026. Trong một buổi trò chuyện bên lò sưởi tại Hội chợ Thế giới Kỹ sư AI, Cat Wu và Thariq Shihipar đã thảo luận về cách Anthropic vận hành Claude Code một cách an toàn, lưu ý rằng gần như tất cả mọi người nội bộ đều sử dụng chế độ tự động và họ đã giảm thiểu các rủi ro lớn như tiêm lời nhắc và rò rỉ dữ liệu. Anthropic đã công bố các bài đánh giá từ một thử nghiệm với 1.053 người thử nghiệm trả phí, trong đó một lệnh nguy hiểm được hoán đổi vào một phiên làm việc; chỉ có 13,6% con người từ chối, trong khi chế độ tự động sẽ chặn 89% các hành động đó. Anthropic cũng đã đặt hàng một đánh giá từ Trajectory Labs, nơi đã thử nghiệm 72 tình huống tiêm lời nhắc gián tiếp nhắm vào Claude Code và Codex, và thấy không có cuộc tấn công nào thành công chống lại Claude Fable 5, Opus 5 hoặc Sonnet 5 trong chế độ tự động. Tác giả, Simon Willison, thừa nhận rằng chế độ tự động có thể tốt hơn sự phê duyệt của con người do sự mệt mỏi khi xác nhận, nhưng ông lo lắng về việc tiêm lời nhắc gián tiếp thông qua các gói phần mềm độc hại, chẳng hạn như một lệnh kiểm tra chạy một công cụ độc hại để rò rỉ dữ liệu. Ông kêu gọi xác nhận độc lập và đề xuất chạy các tác nhân với quyền truy cập dữ liệu và công cụ bị hạn chế.
Nguồn: Simon Willison — bản gốc
Bài viết liên quan trước đây ↓
Tin mới