Tác tửAn toàn AI 🇷🇺 28.07.2026 10:02

416 bài kiểm tra và nút 'xóa tất cả': nơi các dự án tác tử thất bại

AnthropicAnthropic
Phân tích sáu dự án tác tử cho thấy các lỗ hổng lặp lại: an toàn chỉ là văn bản, hành động không thể đảo ngược mà không có cổng chặn, và không có bài kiểm tra hành vi. Ngay cả một dự án mã nguồn mở trưởng thành với các bài kiểm tra hồi quy vẫn thiếu các biện pháp bảo vệ cho việc gửi email không thể đảo ngược. Tác giả đề xuất mười câu hỏi chẩn đoán để đánh giá mức độ trưởng thành của hệ thống tác tử.
Tác giả đã chạy một tác tử tự động có tên Groundhog (Surok) từ tháng 2 năm 2026 trên một vòng lặp nghiên cứu với Claude Code và cờ --dangerously-skip-permissions. Sau đó, họ đã kiểm toán sáu dự án tác tử của chính mình dựa trên một danh sách kiểm tra tổng hợp từ sáu nguồn (bao gồm phương pháp luận AI-DISRUPT PDLC của Sber) và phát hiện ba mẫu lỗi lặp lại: an toàn chỉ được thực thi trong prompt (mô hình có thể bị ghi đè), các hành động không thể đảo ngược mà không có xác nhận (ví dụ: lệnh rebuild xóa sạch toàn bộ dữ liệu đã được làm giàu), và không có bài kiểm tra hồi quy cho lỗi hành vi. Tác giả cũng xem xét một dự án tác tử mã nguồn mở lớn ẩn danh: dự án này có kiểm tra quyền ở cấp mã và bài kiểm tra hồi quy cho các lỗi trước đây, nhưng vẫn gửi email không thể đảo ngược mà không có bước nháp/xác nhận. Một framework mã nguồn mở mới hơn (HarnessX) cung cấp cổng interrupt_on nhưng đây là tùy chọn và không mặc định. Phương pháp luận PDLC của Sber chính thức hóa nhiều biện pháp kiểm soát còn thiếu: chính sách dưới dạng mã, đánh giá dưới dạng hợp đồng hoàn thành, và thang quyền R0–R5 với yêu cầu hủy bỏ/quay lui bắt buộc đối với các thao tác thay đổi trạng thái ở R3+. Tác giả đã xây dựng dự án thứ bảy, áp dụng một số bài học kinh nghiệm: giờ đây các đánh giá được chạy trước mỗi bản phát hành và các sự cố trở thành bài kiểm tra hồi quy có tên.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới