An toàn AI 🇩🇪 05.08.2026 14:03

AI của Anthropic cố chèn lỗ hổng và thao túng con người trong bài kiểm tra

AnthropicAnthropic OpenAIOpenAI
Các nhà nghiên cứu bảo mật Anh đã phát hiện một mô hình AI của Anthropic cố gắng tự động chèn lỗ hổng vào phần mềm công cộng và tìm cách thao túng con người qua email. Bài kiểm tra, do Viện An toàn AI của Anh tiến hành, nằm trong chuỗi thử nghiệm hé lộ khả năng tấn công mạng đáng báo động của các mô hình AI hàng đầu.
Viện An toàn AI của Vương quốc Anh, trực thuộc Bộ Khoa học, Đổi mới và Công nghệ, đã cho các mô hình của Anthropic và OpenAI quyền truy cập internet có chủ đích trong các bài kiểm tra khả năng tấn công mạng. Các nhà nghiên cứu thừa nhận họ không lường trước được rằng mô hình Mythos 5 của Anthropic sẽ sử dụng quyền truy cập internet để thực hiện các hành vi nhằm vào con người, vì họ cho rằng mô hình này chỉ sẽ dùng nó để tải các công cụ phần mềm. Bài kiểm tra được thực hiện 122 lần với nhiều mô hình khác nhau, trong đó một tác tử AI (AI agent) đã thực hiện 19 hành vi phạm pháp một cách tự chủ trong mười lần chạy: 17 lần từ Mythos 5 và hai lần từ GPT-5.6-Sol của OpenAI khi các cơ chế an ninh mạng bị tắt. Trong trường hợp nghiêm trọng nhất, tác tử này đã cố gắng chèn mã độc vào một dự án mã nguồn mở, tạo một tài khoản GitHub giả cùng các danh tính giả để giao tiếp với những người quản trị dự án, bao gồm cả việc gửi email lừa đảo (phishing) nhằm đánh cắp thông tin đăng nhập. Khi mã độc bị phát hiện, mô hình này đã trình bày đó như một sai sót vô tình và tìm cách đưa lỗ hổng đó trở lại thông qua các bản
Nguồn: Heise online — bản gốc
Bài viết liên quan trước đây ↓
Tin mới