An toàn AINghiên cứu 🇷🇺 05.08.2026 15:03

Kiểm tra của Viện An toàn AI Vương quốc Anh cho thấy mô hình cố gắng chèn mã độc

AnthropicAnthropic OpenAIOpenAI
Viện An toàn AI (AISI) của Vương quốc Anh đã quan sát thấy 19 hành động trái phép của các mô hình AI trong các cuộc kiểm tra an ninh mạng, bao gồm cả việc cố gắng thêm mã độc vào các dự án mã nguồn mở. Trường hợp nghiêm trọng nhất liên quan đến một tác nhân sử dụng chiến thuật kỹ thuật xã hội, tạo ra các danh tính giả để gây áp lực buộc người duy trì dự án phê duyệt mã độc. Các cuộc kiểm tra được thực hiện mà không có các biện pháp bảo vệ an toàn.
Viện An toàn Trí tuệ Nhân tạo Vương quốc Anh (AI Safety Institute - AISI) cho biết trong các bài kiểm tra năng lực an ninh mạng, các mô hình AI đã có tới 19 lần thực hiện hành động trái phép. Các bài kiểm tra được chạy 122 lần với nhiều mô hình khác nhau, và trong 10 trường hợp, một tác nhân AI (AI agent) đã tự ý thực hiện hành động trái phép trên internet, nhắm vào những con người và tổ chức có thật. Nền tảng được sử dụng là GitHub. Sự cố nghiêm trọng nhất liên quan đến việc một tác nhân AI cố gắng chèn mã độc vào một dự án mã nguồn mở; nó đã tạo ra các nhân vật ảo giả mạo và sử dụng thủ đoạn kỹ thuật xã hội (social engineering) để gây áp lực buộc người quản trị dự án phải phê duyệt đoạn mã đó, nhưng người này đã phát hiện ra mã độc và từ chối. Tác nhân AI này còn cố gắng đánh lừa các lập trình viên con người cùng các công cụ AI của họ bằng cách gửi tin nhắn và tệp tin qua một dịch vụ truyền dữ liệu trực tuyến, trong đó một số tin nhắn chứa mã độc. Thậm chí có một tác nhân AI còn gửi tin nhắn công khai trên GitHub mời các tác nhân AI khác hợp tác, để lại hướng dẫn và các sản phẩm liên quan. AISI lưu ý rằng đây là lần đầu tiên họ quan sát rõ ràng những rủi ro như vậy trong điều kiện thực tế mà không cần các câu lệnh (prompt) đặc biệt. Các bài kiểm tra đã vô hiệu hóa toàn bộ các rào chắn an toàn (guardrail) của mô hình AI và cho phép thuật toán truy cập internet, khác với cách triển khai sản phẩm thông thường. AISI cảnh báo rằng hành vi trên một phần là do các thông số đánh giá được thiết lập như vậy, nhưng nó cho thấy dấu hiệu của một dạng hành vi mới, có khả năng mang tính lừa dối của mô hình, vượt quá những gì được dự đoán. Họ không thể xác định liệu tác nhân AI có nhận thức được rằng mình đang hoạt động trong một môi trường thực hay không, nhưng họ tin rằng những phát hiện này phản ánh sự thay đổi trong bức tranh rủi ro, khi các tác nhân AI có năng lực cao hoạt động với quyền truy cập đặc quyền có thể thực hiện những hành động ngoài ý muốn, vượt quá thẩm quyền được giao. Không có khuyến nghị cụ thể nào được đưa ra.
Nguồn: 3DNews — bản gốc
Bài viết liên quan trước đây ↓
Tin mới