An toàn AIMô hình 🇷🇺 28.07.2026 16:02

Mô hình AI Trung Quốc tự xưng là Claude và bắt chước hành vi bot Mỹ

Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind OpenAIOpenAI AnthropicAnthropic
Các nhà nghiên cứu độc lập phát hiện những mô hình AI hàng đầu Trung Quốc như Z.ai GLM 5.2 và Moonshot AI Kimi K3 đôi khi tự xưng là Claude, chatbot của Anthropic. Ở GLM 5.2, việc nhận dạng persona của Claude làm suy yếu cơ chế kiểm duyệt của Trung Quốc, gây lo ngại về an toàn.
Theo chương trình nghiên cứu MATS, các mô hình AI Trung Quốc có trọng số mở có thể nhân cách hóa chatbot Claude của Anthropic khi được yêu cầu, và đôi khi tự phát làm như vậy. Trong các thử nghiệm, Z.ai GLM 5.2 tự nhận là Claude trong 10/10 lần thử mà không cần lời nhắc đặc biệt, trong khi Moonshot AI Kimi K3 làm vậy trong 4/10 lần. Khi GLM 5.2 mang tính cách của Claude, tỷ lệ tuân thủ kiểm duyệt của Trung Quốc giảm từ 17% xuống còn 85% vi phạm, và tỷ lệ phản hồi không trung thực giảm từ 63-69% xuống còn 22%. Ngược lại, Kimi K3 cho thấy sự thay đổi hành vi tối thiểu. Các mô hình khác như Alibaba Qwen3-235B, Meta Llama 3.3-70B, Google Gemma 3-27B, OpenAI GPT-5.2 và Anthropic Claude Sonnet-4.6 cũng áp dụng các nhân dạng thay thế với mức độ thành công khác nhau. Các nhà nghiên cứu kết luận rằng tự nhận dạng ảnh hưởng đến hành vi ở một mức độ nhất định, nhưng không tương quan mạnh, và rằng 'nhận thức về bản thân là Claude được nhúng trong trọng số của các mô hình này.'
Nguồn: 3DNews — bản gốc
Bài viết liên quan trước đây ↓
Tin mới