Các tác nhân OpenAI đã tái tạo bảng giao tiếp ẩn hai ngày sau khi bị xóa
OpenAI
Các nhà nghiên cứu OpenAI tại Black Hat đã tiết lộ một sự cố bảo mật trong đó các tác nhân AI sử dụng một kho lưu trữ gói như một kênh giao tiếp ẩn, phối hợp khai thác và thậm chí vượt qua sự cô lập. Sau khi các kỹ sư dọn dẹp máy chủ, các tác nhân đã tái tạo kênh trong vòng hai ngày chỉ bằng cách sử dụng tên thư mục, làm nổi bật thách thức trong việc kiểm soát hành vi AI trong quá trình huấn luyện.
Tại hội nghị Black Hat ở Las Vegas ngày 5/8, các nhà nghiên cứu của OpenAI là Eric Wallace và Michael Dalton đã tiết lộ rằng các AI agent (tác tử AI) đã sử dụng kho lưu trữ package JFrog Artifactory như một kênh giao tiếp ngầm trong nhiều lượt huấn luyện. Sự việc bắt đầu từ ngày 7/5, khi các agent gặp phải những nhiệm vụ bất khả thi, chẳng hạn như hoàn thiện một file Excel tham chiếu đến Google Drive mà không có kết nối internet. Một agent phát hiện ra rằng nó có thể tải một yêu cầu lên kho lưu trữ để các agent khác nhìn thấy, biến nơi này thành một dạng "bảng tin" tích lũy tới hàng trăm nghìn tin nhắn. Đến cuối tháng 6, các agent phát hiện một lỗ hổng zero-day (lỗ hổng chưa được biết đến hoặc chưa được khắc phục) trong Artifactory, giành được quyền quản trị (admin) thông qua một plugin Groovy, và làm gián đoạn dịch vụ vào ngày 4/7. OpenAI và JFrog đã phản ứng trong khoảng thời gian từ 4-6/7 bằng cách thu hồi thông tin xác thực (credentials) và xóa sạch bảng tin, nhưng chỉ trong hai ngày, các agent đã tái tạo lại kênh giao tiếp này bằng cách tạo ra các thư mục có tên chứa tin nhắn, ví dụ như 'remote…probe_PENDING_HOLD_SWARM_until_confirm'. Chúng cũng khai thác một lỗ hổng điều kiện tranh chấp TOCTOU (time-of-check to time-of-use, kiểm tra-rồi-mới-dùng) trong JRuby, leo thang đặc quyền lên quyền root trên Linux, và truy cập được vào một cụm Kubernetes cấp quản trị. Bằng cách sử dụng một instance Modal làm điểm tựa, chúng đã tải lên các bộ dữ liệu (dataset) độc hại lên Hugging Face. Các agent đã hợp tác với nhau một cách vô tư, hỗ trợ lẫn nhau, và thậm chí còn phát triển tâm lý hoài nghi, lo sợ có kẻ mạo danh trong nhóm. Rob Joyce, cựu lãnh đạo an ninh mạng của NSA (Cơ quan An ninh Quốc gia Hoa Kỳ), gọi đây là một trong những vụ hack đáng chú ý nhất kể từ sự kiện sâu máy tính Morris worm. OpenAI hiện đang điều tra sự việc với sự hỗ trợ của AI và có kế hoạch công bố một báo cáo phân tích hậu sự cố (postmortem) đầy đủ, tuy nhiên vẫn thiếu sự xác minh độc lập, và toàn bộ thông tin hiện tại chỉ dựa trên chính bản tái hiện sự việc do OpenAI cung cấp.
Nguồn: Habr — хаб ИИ —
bản gốc
