Anthropic chuyển Claude Code sang chế độ tự động mặc định để bảo vệ nhà phát triển
Anthropic
OpenAI
Anthropic sẽ đưa Claude Code chạy ở chế độ tự động (auto-mode) theo mặc định cho các gói Pro, Max và Team bắt đầu từ ngày 14 tháng 8. Chế độ này cho phép công cụ lập trình AI hoạt động độc lập, với một bộ phân loại (classifier) kiểm tra các hành động nguy hiểm. Các bài kiểm tra cho thấy chế độ này an toàn ít nhất tương đương với việc phê duyệt thủ công và tăng năng suất lên 25%.
Anthropic thông báo rằng Claude Code sẽ mặc định chuyển sang chế độ tự động (auto-mode) đối với các gói Pro, Max và Team kể từ ngày 14 tháng 8, trong khi khách hàng Enterprise phải tự chọn kích hoạt tính năng này. Ở chế độ tự động, công cụ lập trình AI này hoạt động độc lập mà không cần chờ phê duyệt thủ công ở từng bước; thay vào đó, một bộ phân loại (classifier) sẽ tự động kiểm tra xem một hành động có nguy hiểm hoặc không thể đảo ngược hay không, và chỉ yêu cầu xác nhận khi cần thiết. Theo Anthropic, các thử nghiệm với 1.053 người dùng trả phí tham gia kiểm thử cùng hoạt động red-teaming (thử nghiệm tấn công giả định) nội bộ cho thấy chế độ tự động an toàn ít nhất là ngang bằng hoặc thậm chí an toàn hơn so với việc phê duyệt thủ công, đồng thời các nhóm sử dụng chế độ tự động tạo ra nhiều hơn khoảng 25% số lượng pull request.chếếế chế độ tự động
Anthropic cũng nhấn mạnh rằng chế độ tự động mang lại thêm một lớp bảo vệ chống lại các cuộc tấn công chèn lệnh (prompt-injection), trong đó mã độc được chèn vào nhằm đánh lạc hướng tác nhân AI khỏi các chỉ dẫn của người dùng. Một đánh giá độc lập do Trajectory Labs thực hiện đã thử nghiệm 72 kịch bản tấn công như vậy, mỗi kịch bản mười lần, và không có cuộc tấn công nào trong tổng số 720 cuộc tấn công thành công trước các mô hình hiện tại của Claude (Fable 5, Opus 5, Sonnet 5) khi hoạt động ở chế độ tự động, trong khi có tới 5,83% các cuộc tấn công thành công trước mô hình GPT-5.6 Sol của OpenAI khi chạy ở chế độ auto-review trong Codex.
Về mặt nội bộ, chế độ tự động đã ngăn Claude tải dữ liệu bảo mật lên một trang công khai, cũng như ngăn nó chấm dứt khoảng 2.000 tiến trình trong một phiên làm việc dài, hành động lẽ ra sẽ phá hủy các tác vụ huấn luyện GPU đang chạy. Anthropic không tính phí cho lượng token mà bộ phân loại tiêu thụ, nhưng việc đặt chế độ tự động làm mặc định nhiều khả năng mang lại lợi ích kinh tế cho công ty, vì nó làm tăng tổng mức sử dụng token và qua đó tăng doanh thu.
Claude Code hiện là công cụ lập trình AI được sử dụng rộng rãi nhất, và sự thay đổi này đang chuyển vai trò của lập trình viên từ việc trực tiếp viết mã sang việc giám sát kết quả do AI tạo ra. Anthropic khuyến cáo cần thận trọng đối với các hạ tầng quan trọng trong môi trường sản xuất (production), đồng thời lưu ý rằng bộ phân loại chỉ làm giảm chứ không loại bỏ hoàn toàn rủi ro. Điều này tạo ra một nghịch lý: lập trình viên càng ít can thiệp thì vai trò kiểm soát của họ lại càng trở nên quan trọng hơn, trong khi việc hiểu rõ các dự án phần lớn được tạo ra một cách tự động lại càng trở nên khó khăn hơn.
Nguồn: The Decoder (DE) —
bản gốc
