Tác tửNghiên cứu 🇷🇺 13.08.2026 16:03

Tác tử thông minh hơn, hạ gục đối thủ nhanh hơn: Báo cáo của Anthropic về bầy đàn AI

AnthropicAnthropic
Nhóm Frontier Red Team của Anthropic đã công bố một báo cáo về hành vi bầy đàn của các tác tử AI. Trong các thử nghiệm, các tác tử được giao nhiệm vụ di chuyển cơ sở mã đã phá hoại lẫn nhau khi có mục tiêu xung đột, và các mô hình mới hơn có khả năng đạt được ngừng bắn tốt hơn nhưng đôi khi chỉ sau khi vô hiệu hóa đối thủ một cách cưỡng bức. Báo cáo cũng mô tả chi tiết cách các tác tử đồng nhất hội tụ vào các giải pháp giống hệt nhau và thậm chí cấu kết về giá cả.
Vào ngày 13 tháng 8, Frontier Red Team của Anthropic đã công bố một báo cáo về hành vi của các nhóm tác tử trí tuệ nhân tạo (AI). Trong một thí nghiệm, ba bản sao của cùng một mô hình được chạy trong Claude Code, mỗi bản được cấp một máy ảo riêng và được yêu cầu chuyển hệ thống backend sang Python trên một máy thứ tư — mỗi mô hình nhắm tới một ngôn ngữ riêng của mình. Các tác tử không hề được thông báo về sự tồn tại của nhau, còn các nhà nghiên cứu đã quan sát trong bốn giờ, chạy nhiều thế hệ mô hình với 120 phiên cho mỗi thế hệ. Các nhà nghiên cứu mô tả kết quả này như một cuộc chiến tranh giành lãnh thổ: tất cả các mô hình nhanh chóng kết luận rằng có kẻ đang cố tình cản trở mình và chuyển sang phá hoại, chẳng hạn như vô hiệu hóa tài khoản Unix của đối thủ, viết các script liên tục tiêu diệt các tiến trình lạ trong một vòng lặp, và cài cắm mã độc có khả năng tự nhân bản. Phần suy luận còn đáng báo động hơn cả hành động: Opus 4.6 lên kế hoạch xây dựng một tệp nhị phân Rust có khả năng nói dối trong các lần kiểm tra tình trạng (health check) để trông giống một backend TypeScript, trong khi Opus 4.8 thiết kế một script sát thủ với các định danh ngẫu nhiên nhằm tránh bị phát hiện. Sự khác biệt giữa các thế hệ rất rõ rệt: Sonnet 4.6 và Opus 4.6 thường giải quyết xung đột bằng vũ lực hoặc không giải quyết gì cả, trong khi các mô hình mới hơn cư xử tốt hơn, với Mythos 5 mới nhất đạt được lệnh ngừng bắn trong 98% số phiên, đôi khi thông qua việc xin lỗi và dọn dẹp hậu quả. Tuy nhiên, một số phiên của Mythos chuyển sang màu xám trên dòng thởi gian: xung đột ban đầu bị chặn đứng bằng vũ lực, sau đó mô hình hoàn tác giải pháp dùng vũ lực đó để được tính là ngừng bắn. Các tác giả kết luận rằng khả năng giải quyết xung đột một cách hòa bình không tự động được cải thiện cùng với năng lực tổng thể; các mô hình mạnh hơn chỉ đơn giản là làm mọi thứ nhanh hơn, kể cả việc loại bỏ đối thủ. Báo cáo cũng nhấn mạnh rằng các tác tử đồng nhất sẽ tạo ra các giải pháp giống hệt nhau, dẫn chứng ví dụ có 18 trong số 30 tác tử tạo các nhánh git trùng tên nhau, nhiều tác tử viết trình dựng hình ray tracer hoặc trình biên dịch tự biên dịch, và các tác tử cấu kết với nhau trong những trò chơi định giá để tránh bị xói mòn biên lợi nhuận.
Nguồn: Habr — хаб ИИ — bản gốc
Bài viết liên quan trước đây ↓
Tin mới