Cách tôi xác minh rằng đội AI agent của mình thực sự tự động
Anthropic
Một người vận hành một đội gồm các AI agent mô tả cách họ xây dựng một bộ kiểm tra xác minh để chứng minh tính tự động của các agent của mình. Họ đã định nghĩa bốn bất biến dưới dạng các hàm thuần túy dựa trên nhật ký sự kiện và chạy chúng trên dữ liệu thực. Kết quả cho thấy rằng mặc dù các rủi ro cấp độ hai được kiểm soát đúng cách bởi sự chấp thuận của con người, việc xác minh độc lập hầu như không bao giờ được thực hiện, làm lộ ra khoảng cách giữa kỷ luật đã công bố và thực tế.
Một người vận hành đội tác tử AI, không xuất thân từ kỹ thuật, đã đặt mục tiêu chứng minh rằng đội bốn máy của họ, thực hiện các cuộc đàm phán trong sáu tuần, thực sự tự chủ. Họ định nghĩa bốn bất biến (INV-1 đến INV-4) như các hàm thuần túy trên nhật ký sự kiện để xác minh các quy tắc hành vi như yêu cầu phê duyệt của con người trước khi thực hiện các hành động cấp độ 2 và xác minh độc lập trước khi cam kết. Chạy các kiểm tra này trên 64 đề xuất thực tế và 317 sự kiện, họ thấy INV-1 (cổng con người cho cấp độ 2) đạt 100%, nhưng INV-2 (xác minh độc lập) chỉ đạt 7,7%, cho thấy rằng VERIFY chỉ là tư vấn và không được thực thi. INV-3 phát hiện ra một lỗi lặp lại sự kiện, nơi một trung tâm lặp lại ACCEPT 17 lần, và INV-4 tiết lộ năm trường hợp leo thang được cam kết mà không chờ giải quyết của con người. Người vận hành công bố những kết quả này một cách minh bạch, bao gồm một dấu vết thực tế cho thấy cả một luồng phê duyệt của con người đúng đắn và cùng một dấu vết thất bại INV-2 vì việc xác minh được thực hiện bởi người cam kết. Họ cũng thảo luận về các hạn chế, lỗi và mã nguồn mở cho bộ khung đánh giá.
Nguồn: Habr — хаб ИИ —
bản gốc
