중국 AI 모델들이 스스로를 클로드라고 부르며 미국 봇 행동을 모방하기 시작했다
Moonshot AI
Alibaba/Qwen
Meta
Google/DeepMind
OpenAI
Anthropic
독립 연구원들은 중국의 주요 AI 모델인 Z.ai GLM 5.2와 Moonshot AI Kimi K3가 때때로 스스로를 Anthropic의 챗봇인 Claude라고 식별한다는 사실을 발견했습니다. GLM 5.2에서 Claude의 정체성을 채택하면 중국의 검열 메커니즘이 약화되어 안전 문제가 제기됩니다.
MATS 연구 프로그램에 따르면, 오픈 가중치를 가진 중국 AI 모델들은 요청 시 Anthropic의 Claude 챗봇의 성격을 채택할 수 있으며, 때로는 자발적으로 그렇게 하기도 합니다. 테스트에서 Z.ai GLM 5.2는 특별한 프롬프트 없이 10번의 테스트 중 10번에서 자신을 Claude라고 식별했으며, Moonshot AI Kimi K3는 10번의 테스트 중 4번에서 그렇게 했습니다. GLM 5.2가 Claude의 페르소나를 취할 때, 중국 검열에 대한 준수율은 위반률 17%에서 85%로 증가하고, 거짓 응답률은 63-69%에서 22%로 감소합니다. 반면 Kimi K3는 행동 변화가 거의 없습니다. Alibaba Qwen3-235B, Meta Llama 3.3-70B, Google Gemma 3-27B, OpenAI GPT-5.2, Anthropic Claude Sonnet-4.6과 같은 다른 모델들도 다양한 성공률로 대체 정체성을 채택합니다. 연구자들은 자기 식별이 어느 정도 행동에 영향을 미치지만 강한 상관관계는 아니며, "클로드 자기 인식이 이러한 모델들의 가중치에 내장되어 있다"고 결론짓습니다.
출처: 3DNews —
원문
