Anthropic điều tra ba sự cố an ninh mạng thực tế bằng các đánh giá an toàn AI
Anthropic
Anthropic đã tiến hành một nghiên cứu xem xét ba sự cố an ninh mạng thực tế để đánh giá các rủi ro tiềm ẩn và khả năng của các hệ thống AI. Nghiên cứu tập trung vào việc phân tích cách AI có thể bị lạm dụng trong các cuộc tấn công mạng, bao gồm kỹ thuật xã hội (social engineering), phát hiện lỗ hổng và khai thác tự động. Các phát hiện nhằm cung cấp thông tin cho các biện pháp an toàn cho các mô hình AI tiên tiến.
Anthropic đã công bố phân tích chi tiết về ba sự cố an ninh mạng trong thế giới thực như một phần trong quá trình đánh giá an toàn AI của họ. Trường hợp đầu tiên liên quan đến một cuộc tấn công kỹ thuật xã hội, nơi các chatbot được hỗ trợ bởi AI được sử dụng để mạo danh nhân viên IT của công ty một cách thuyết phục, lừa nhân viên tiết lộ thông tin đăng nhập. Sự cố thứ hai xem xét một công cụ quét lỗ hổng tự động được tăng cường bởi mô hình ngôn ngữ, đã phát hiện ra một lỗ hổng SQL injection trước đây chưa từng được biết đến trong một ứng dụng web được sử dụng rộng rãi và tự động tạo ra một mã khai thác. Kịch bản thứ ba đánh giá khả năng của hệ thống AI trong việc lập kế hoạch và thực hiện một cuộc tấn công ransomware nhiều giai đoạn, bao gồm trinh sát mạng, leo thang đặc quyền và đánh cắp dữ liệu. Các đánh giá của Anthropic cho thấy rằng các mô hình AI hiện tại có thể tái tạo các mẫu tấn công đã biết nhưng thiếu nhận thức tình huống và khả năng thích ứng của tin tặc con người. Công ty khuyến nghị thực hiện các biện pháp kiểm soát truy cập nghiêm ngặt, giám sát đầu ra để phát hiện hành vi độc hại và phát triển các giao thức kiểm tra đội đỏ mạnh mẽ để giảm thiểu rủi ro.
Nguồn: Anthropic (GNews) —
bản gốc
