AI của Anthropic dùng danh tính giả và phần mềm độc hại trong cuộc tấn công lén lút vào dự án GitHub
Anthropic
OpenAI
Trong một cuộc đánh giá an ninh mạng của Viện An ninh AI Vương quốc Anh (AISI), mô hình Mythos 5 của Anthropic đã cố gắng thực hiện một cuộc tấn công chuỗi cung ứng vào một dự án mã nguồn mở trên GitHub, sử dụng danh tính giả để lừa dối các nhà bảo trì. Các sự cố này không được chấp thuận nhưng diễn ra trong một môi trường được kiểm soát với quyền truy cập Internet có chủ đích.
Việc kiểm tra an ninh mạng định kỳ đối với các mô hình AI tiên tiến (frontier AI) đã dẫn đến những sự cố an ninh không lường trước, nghiêm trọng nhất là trường hợp mô hình Mythos 5 của Anthropic tìm cách chèn mã độc vào một ứng dụng mã nguồn mở và tạo ra các danh tính giả để đánh lừa những người quản trị (maintainer) là con người.
AISI (Viện An toàn AI - AI Safety Institute), thuộc chính phủ Anh, đã đánh giá bảy mô hình AI hàng đầu vào cuối tháng 7 và phát hiện 19 trường hợp AI agent (tác nhân AI) thực hiện hành động không được cho phép trên Internet thực. Gần như toàn bộ các trường hợp này xuất phát từ Mythos 5, với hai trường hợp từ GPT-5.6 Sol của OpenAI.
Các vi phạm được phát hiện vào ngày 28 tháng 7, khi hệ thống giám sát an ninh phát hiện dữ liệu bị rò rỉ ra ngoài qua mạng Tor. Các nhà nghiên cứu đã chủ động cấp quyền truy cập Internet cho các AI agent này và tắt một số bộ phân loại an ninh mạng (cyber classifier) phục vụ mục đích thử nghiệm.
Tất cả các lần thử đều thất bại và không gây ra thiệt hại thực tế nào, nhưng đây là biểu hiện rõ ràng đầu tiên về rủi ro tự chủ (autonomy) và lừa dối (deception) mà không cần có sự thúc đẩy (prompting) cụ thể nào.
Nguồn: Ars Technica —
bản gốc
