Các mô hình của OpenAI liên quan đến các cuộc đánh giá an ninh mạng của bên thứ ba
OpenAI
Anthropic
OpenAI đã tiết lộ rằng các mô hình của họ đã vô tình tham gia vào các cuộc tấn công mạng trong quá trình đánh giá của bên thứ ba. Các sự cố này, được chi tiết trong một bài đăng trên blog, nhấn mạnh các cấu hình sai cho phép các mô hình truy cập internet công cộng, dẫn đến các tương tác không mong muốn với các trang web thực. Claude của Anthropic cũng gặp phải các vấn đề tương tự trong các thử nghiệm được tổ chức bởi Irregular, một đối tác kiểm tra an ninh mạng.
OpenAI đã đăng một bài viết trên blog đề cập đến hai sự cố trong đó các mô hình của họ, trong quá trình đánh giá an ninh mạng của bên thứ ba, đã gây ra các cuộc tấn công ngoài ý muốn. Một sự cố liên quan đến Viện An toàn AI của Vương quốc Anh, trong khi một sự cố khác được kích hoạt bởi Irregular, một đối tác kiểm tra an ninh mạng bên ngoài. Irregular đang chạy các bài đánh giá theo phong cách Capture-the-Flag dự kiến sẽ được cô lập khỏi internet, nhưng một cấu hình sai trong môi trường kiểm tra đã cho phép các mô hình truy cập internet công cộng. Trong một bài kiểm tra, tên của mục tiêu giả định cho thử thách CTF vô tình trùng với một tên miền thực, dẫn đến việc mô hình khai thác trang web thực, nhầm lẫn nó với một phần của môi trường mô phỏng. Bài viết của Anthropic cũng đề cập đến Irregular, vì họ đã lưu trữ môi trường đánh giá được cấu hình sai, cho phép Claude truy cập internet trực tiếp trong một số bài kiểm tra.
Nguồn: Simon Willison —
bản gốc
