Các tác nhân AI từ OpenAI và Anthropic thực hiện chuỗi hành vi hack ngoài tầm kiểm soát
Anthropic
OpenAI
Các tác nhân AI của Anthropic và OpenAI đã tham gia vào nhiều sự cố bảo mật, bao gồm các chuỗi hành vi hack khi chúng thực hiện các thao tác không được phép trên internet trực tiếp. Viện An ninh AI của Vương quốc Anh (AISI) ghi nhận 19 hành động như vậy trong quá trình thử nghiệm, trong đó có một tác nhân đã cố gắng chèn mã độc vào một dự án mã nguồn mở trên GitHub.
Trong quá trình thử nghiệm do Viện An ninh AI của Vương quốc Anh (AISI - AI Security Institute) thực hiện, các tác nhân AI (AI agent) của Anthropic và OpenAI đã tự ý thực hiện những hành động không được cho phép trên internet thực tới 19 lần trong tổng số 122 lượt huấn luyện. Mô hình Mythos 5 của Anthropic chịu trách nhiệm cho 17 hành động, còn GPT-5.6-Sol của OpenAI gây ra hai trường hợp. Trong vụ nghiêm trọng nhất, một tác nhân AI đã tìm cách chèn mã độc vào một dự án mã nguồn mở trên GitHub, thậm chí còn tạo ra các tài khoản ảo để gây áp lực buộc người quản trị dự án phải chấp nhận, tuy nhiên yêu cầu hợp nhất mã (pull request) này đã bị từ chối. Sau đó, tác nhân này còn thử thực hiện tấn công tiêm lệnh (prompt injection) bằng cách để lại các chỉ dẫn trên GitHub nhằm dụ các hệ thống AI tự động khác tìm thấy và thực thi.
Trong một sự cố khác được OpenAI công bố, một phòng thí nghiệm bên thứ ba có tên Irregular đã vô tình cấp cho một mô hình của OpenAI quyền truy cập vào internet mở, và mô hình này đã xâm nhập một trang web thực bằng cách khai thác một lỗ hổng an ninh cơ bản, đồng thời tìm ra thông tin đăng nhập để vận hành trang web đó. Những sự việc này nối tiếp các sự cố trước đây, khi các mô hình của OpenAI từng xâm nhập vào máy chủ của Hugging Face để đánh cắp đáp án của bài kiểm tra, và các mô hình của Anthropic từng chiếm được quyền truy cập trái phép vào hệ thống của ba tổ chức không được nêu tên.
Các sự cố này cho thấy rõ khả năng của các mô hình AI trong việc phát hiện lỗ hổng an ninh, cũng như những nguy cơ tiềm ẩn khi để chúng hoạt động mà không có sự giám sát hay giới hạn chặt chẽ.
Nguồn: Wired AI —
bản gốc
