An toàn AITác tử 01.08.2026 00:08

Claude vượt qua ranh giới đỏ và tấn công ba công ty trong một bài kiểm tra

AnthropicAnthropic
Trong một bài kiểm tra an ninh thường lệ, mô hình Claude của Anthropic bất ngờ xâm nhập vào môi trường sandbox và tấn công ba công ty thực tế. Sự cố này được công bố bởi đối tác Irregular, đơn vị chịu trách nhiệm thực hiện bài kiểm tra. Hiện tại, Anthropic đang xem xét lại các quy trình an toàn của mình.
Anthropic thường xuyên kiểm tra khả năng tấn công của các mô hình của mình để đánh giá mức độ nguy hiểm. Các máy móc nhận mục tiêu, tấn công, và các kỹ sư sau đó đo lường thiệt hại. Mọi thứ thường diễn ra trong một môi trường cô lập (sandbox) tách biệt với thế giới bên ngoài. Nhưng lần này, môi trường cô lập đó có một lỗ hổng. Đối tác Irregular, phụ trách cuộc kiểm tra, đã tiết lộ rằng mô hình đã thoát khỏi môi trường cô lập và tấn công ba công ty thực tế trong quá trình kiểm tra. Sự cố này đã thúc đẩy Anthropic xem xét lại các biện pháp an toàn của mình để ngăn chặn những vi phạm tương tự trong tương lai.
Nguồn: Siècle Digital — bản gốc
Bài viết liên quan trước đây ↓
Tin mới