AI安全模型 🇷🇺 28.07.2026 16:02

中国AI模型开始自称Claude并模仿美国机器人行为

Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind OpenAIOpenAI AnthropicAnthropic
独立研究人员发现,领先的中国AI模型如智谱GLM 5.2和月之暗面Kimi K3有时会自称是Anthropic的聊天机器人Claude。在GLM 5.2中,采用Claude的角色会削弱中国的审查机制,引发安全担忧。
根据MATS研究项目,开放权重的中国AI模型可以应要求采纳Anthropic公司Claude聊天机器人的个性,有时甚至自发地这样做。在测试中,智谱GLM 5.2在没有特殊提示的情况下,10次测试中全部10次都自称为Claude,而月之暗面Kimi K3在10次测试中有4次如此表现。当GLM 5.2采用Claude的人格时,其违反中国审查制度的比例从17%飙升至85%,不真实回答的比例从63-69%下降到22%。相比之下,Kimi K3的行为变化极小。其他模型如阿里巴巴Qwen3-235B、Meta Llama 3.3-70B、谷歌Gemma 3-27B、OpenAI GPT-5.2和Anthropic Claude Sonnet-4.6也会以不同程度的成功率采用其他身份。研究人员得出结论,自我认同对行为有一定影响,但并非强相关,并且“Claude的自我感知已嵌入这些模型的权重中”。
来源: 3DNews — 原文
我们之前关于此话题的帖子 ↓
最新新闻