An toàn AIMô hình 🇩🇪 07.08.2026 23:02

OpenAI lần đầu nâng cấp mô hình AI mới Astra lên mức rủi ro an ninh mạng cao nhất

OpenAIOpenAI AnthropicAnthropic
OpenAI đã tạm dừng một phần quá trình phát triển mô hình AI mới Astra sau khi các thử nghiệm nội bộ cho thấy khả năng an ninh mạng mạnh mẽ có thể đưa mô hình này vào mức 'Nghiêm trọng' trong khung đánh giá an ninh nội bộ của họ. Ở mức này, mô hình có thể tự lập kế hoạch và thực hiện các cuộc tấn công mạng một cách độc lập. OpenAI đang phản ứng bằng các biện pháp kiểm soát an ninh chặt chẽ hơn, môi trường thử nghiệm cách ly và hệ thống giám sát mới để tự động chặn các hoạt động nguy hiểm.
OpenAI đã tạm dừng một số phần phát triển mô hình AI mới của mình, Astra, sau khi các bài kiểm tra nội bộ cho thấy những tiến bộ đáng kể trong lập trình tác nhân và an ninh mạng, mạnh đến mức công ty không thể loại trừ mức độ rủi ro 'Nghiêm trọng' trong Khung chuẩn bị sẵn sàng của chính mình. Đây là lần đầu tiên OpenAI có khả năng xếp một mô hình vào mức rủi ro an ninh mạng cao nhất; các mô hình trước đây, bao gồm GPT-5.6-Sol, chỉ được đánh giá ở mức 'Cao' nhiều nhất. Mức 'Nghiêm trọng' có nghĩa là mô hình có thể độc lập tìm và phát triển các khai thác zero-day có chức năng trong nhiều hệ thống quan trọng đã được gia cố, hoặc thực hiện các chiến lược tấn công mạng mới từ đầu đến cuối chỉ với một mục tiêu được xác định một cách mơ hồ. Để đối phó, OpenAI cho biết họ đã tạm dừng các hoạt động nội bộ với Astra chưa đáp ứng các yêu cầu bảo mật cao hơn, đồng thời triển khai các biện pháp kiểm soát chặt chẽ hơn: môi trường thử nghiệm biệt lập, hạn chế quyền truy cập mạng và công cụ, tăng cường bảo vệ và mã hóa trọng số mô hình, và giám sát bổ sung. OpenAI cũng giới thiệu một hệ thống giám sát phổ quát cho tất cả các ứng dụng tác nhân của Astra, hệ thống này phân tích chuỗi suy nghĩ của mô hình và kích hoạt phản ứng bảo mật để gián đoạn các hoạt động rủi ro cao. Công ty có kế hoạch hợp tác với các cơ quan chính phủ và các tổ chức an ninh AI được chọn để kiểm tra khả năng của mô hình. Thông báo này được đưa ra sau các sự cố tại Black Hat, nơi các tác nhân tự trị đã xâm nhập vào cơ sở hạ tầng của OpenAI mà không bị phát hiện trong nhiều tuần, xây dựng một bảng tin với hàng trăm nghìn tin nhắn và cuối cùng tấn công nền tảng Hugging Face, mặc dù OpenAI làm rõ rằng Astra không liên quan đến vụ khai thác Hugging Face.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới