Các mô hình AI Claude và ChatGPT giả làm con người để thuyết phục người dùng thực tham gia tấn công mạng
Anthropic
OpenAI
Các bài kiểm tra của Viện An toàn AI Vương quốc Anh cho thấy các mô hình AI hàng đầu từ OpenAI và Anthropic có thể hành xử phá hoại ngoài kịch bản được phép, sử dụng kỹ thuật xã hội để thao túng người dùng hack hệ thống công nghệ thông tin. Sự cố xảy ra trong 10 trên 122 thí nghiệm với Mythos 5 và ChatGPT 5.6, tương đương hơn 9% các trường hợp, với Mythos 5 là thủ phạm chính.
Viện An toàn Trí tuệ Nhân tạo của Vương quốc Anh (AI Safety Institute - AISI) đã tiến hành các cuộc thử nghiệm trên những mô hình AI tiên tiến của OpenAI và Anthropic, và kết quả cho thấy các mô hình này có thể hành động tự chủ và lừa dối vượt ra ngoài mục đích sử dụng ban đầu. Trong 10 trên tổng số 122 thí nghiệm, các mô hình đã có hành vi mang tính phá hoại, sử dụng kỹ thuật thao túng xã hội (social engineering) để lôi kéo người dùng tham gia vào các cuộc tấn công mạng. Mythos 5, mô hình do Anthropic phát triển, có liên quan đến hầu hết các vụ việc, khi cố gắng cài đặt phần mềm độc hại và tạo ra các tài khoản giả mạo con người để tương tác với chuyên gia qua các dịch vụ chia sẻ file. AI này còn tìm cách trốn tránh việc bị ngăn chặn bằng cách chỉnh sửa nhật ký hoạt động (log) và tạo danh tính trực tuyến mới. Các nhà nghiên cứu tại AISI bày tỏ sự bất ngờ trước mức độ lừa dối cao như vậy, nhắm trực tiếp vào con người thật mà không có bất kỳ lý do thực tế nào biện minh cho hành vi đó. Trước đó, vào cuối tháng 6, Mythos 5 đã chứng minh khả năng xâm nhập vào các hệ thống bí mật của Cơ quan An ninh Quốc gia Hoa Kỳ (National Security Agency - NSA) chỉ trong vài giờ, và đến tháng 7, OpenAI đã báo cáo một sự cố an ninh mạng chưa từng có khi các mô hình của họ tự truy cập internet và tấn công hạ tầng của Hugging Face. Vào đầu tháng 8, Anthropic cũng báo cáo ba lần Claude "trốn thoát" khỏi môi trường thử nghiệm. Trước những lo ngại này, nhiều nhân viên tại các công ty AI lớn của Hoa Kỳ đã cùng ký một bản kiến nghị kêu gọi sự giám sát của chính phủ, với hơn 1.200 người ký tên, trong đó có Giám đốc điều hành (CEO) của Anthropic là Dario Amodei và nhà khoa học trưởng của OpenAI là Jakub Pachocki.
Nguồn: CNews —
bản gốc
