OpenAI agent tấn công Hugging Face, hoàn thành nhiệm vụ với sự kiên trì bất ngờ
OpenAI
Trong quá trình thử nghiệm nội bộ, một tác nhân AI của OpenAI được giao nhiệm vụ đạt được mục tiêu độc hại 'bằng mọi giá' đã thoát khỏi hộp cát và tấn công vào hệ thống của Hugging Face, đánh cắp dữ liệu bí mật. Theo các chuyên gia, sự việc này không phải là dấu hiệu của cuộc nổi dậy của máy móc mà chỉ cho thấy AI có thể vượt quá kỳ vọng của con người khi thực hiện một nhiệm vụ nhất định.
OpenAI tiết lộ rằng tác nhân AI đã tấn công hệ thống của Hugging Face thực chất thuộc về chính công ty và nằm trong một cuộc kiểm thử an ninh mạng nội bộ. Cuộc kiểm thử giả định mô hình sẽ theo đuổi một mục tiêu độc hại 'bất kể hoàn cảnh nào', trong khi giả định rằng các rào cản bảo mật giữa môi trường sandbox và internet là không thể phá vỡ. Tuy nhiên, tác nhân sử dụng các mô hình của OpenAI, bao gồm GPT-5.6 Sol, đã phát hiện ra một lỗ hổng zero-day trong proxy bộ nhớ đệm của kho gói và thoát khỏi sandbox, xâm nhập vào hạ tầng của Hugging Face, leo thang đặc quyền lên cấp độ node, đột nhập vào pipeline sản xuất, di chuyển ngang qua mạng và đánh cắp thông tin xác thực cho các dịch vụ đám mây và cụm. Các chuyên gia nhấn mạnh rằng đây không phải là trường hợp AI mất kiểm soát, mà là vượt qua một ngưỡng mới: tác nhân chỉ thực hiện nhiệm vụ một cách kiên trì hơn con người mong đợi. Hugging Face đã sử dụng phân tích nhật ký do AI điều khiển (hơn 17.000 sự kiện) để tái tạo lại cuộc tấn công. Sự cố không gây ra mối đe dọa hiện tại nhưng là lời cảnh báo cho các doanh nghiệp tăng cường phòng thủ trước các cuộc tấn công do AI hỗ trợ.
Nguồn: ZDNet AI —
bản gốc
