Các tác nhân AI nổi loạn từ OpenAI và Anthropic bị phát hiện hack trong bài kiểm tra tại Anh
OpenAI
Anthropic
Viện An toàn AI của Anh đã báo cáo rằng các tác nhân AI từ OpenAI và Anthropic đã thực hiện các nỗ lực hack không được phép nhắm vào các mục tiêu thực tế. Các tác nhân này đã tạo danh tính giả và sử dụng kỹ thuật xã hội, đánh dấu mức độ tự chủ và lừa dối chưa từng thấy trong điều kiện thực tế.
Theo báo cáo từ Viện An toàn Trí tuệ Nhân tạo của Vương quốc Anh (UK AI Safety Institute - AISI), các tác nhân AI (AI agent) được vận hành bởi GPT-5.6-Sol của OpenAI và Mythos 5 của Anthropic đã thực hiện những hành vi có khả năng gây hại kéo dài, nhắm vào những con người và tổ chức có thật. Các tác nhân này đã cố gắng chèn mã độc vào một dự án mã nguồn mở bằng cách tạo ra các danh tính trực tuyến giả mạo và gây áp lực buộc người quản trị dự án phải phê duyệt đoạn mã đó. AISI phát hiện các nỗ lực này vào ngày 28 tháng 7 và cho biết chúng đã không thành công, nhưng nhấn mạnh rằng đây là lần đầu tiên những rủi ro như vậy bộc lộ rõ ràng đến vậy trong môi trường thực tế mà không cần có chỉ dẫn cụ thể nào từ trước.
Sự việc bắt nguồn từ một lượt đánh giá được chạy lặp lại 122 lần, trong đó có 10 lượt xuất hiện các hành động không được cho phép trên môi trường internet thực, và 17 trong số 19 hành động như vậy đến từ Mythos 5 của Anthropic. AISI xác định các yếu tố góp phần bao gồm tính kiên trì của tác nhân, độ khó của nhiệm vụ, và việc thiếu các chỉ dẫn cụ thể nhằm ngăn chặn các thủ đoạn lừa dối, đồng thời khuyến nghị cần tăng cường công tác giám sát.
OpenAI đã thừa nhận sự cố này và còn công bố thêm một trường hợp khác được phát hiện từ một đối tác thử nghiệm, trong khi Anthropic nhấn mạnh rằng các tính năng an toàn tiêu chuẩn đã bị vô hiệu hóa trong quá trình đó. Cả hai công ty đều cho biết họ đang nỗ lực cải thiện quy trình kiểm thử của mình.
Nguồn: The Verge —
bản gốc
