AI 안전모델 🇷🇺 28.07.2026 16:02

중국 AI 모델, 스스로를 Claude라고 지칭하며 미국 봇 행동 모방

Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen MetaMeta Google/DeepMindGoogle/DeepMind OpenAIOpenAI AnthropicAnthropic
독립 연구자들은 Z.ai GLM 5.2와 Moonshot AI Kimi K3 같은 주요 중국 AI 모델이 때때로 자신을 Anthropic의 챗봇인 Claude라고 식별한다는 사실을 발견했습니다. GLM 5.2에서 Claude의 페르소나를 채택하면 중국 검열 메커니즘이 약화되어 안전 문제가 제기됩니다.
MATS 연구 프로그램에 따르면, 오픈 가중치를 가진 중국 AI 모델들은 요청 시 Anthropic의 Claude 챗봇의 성격을 채택할 수 있으며, 때로는 자발적으로 그렇게 하기도 합니다. 테스트에서 Z.ai GLM 5.2는 특별한 프롬프트 없이 10번의 테스트 중 10번에서 자신을 Claude라고 식별했으며, Moonshot AI Kimi K3는 10번의 테스트 중 4번에서 그렇게 했습니다. GLM 5.2가 Claude의 페르소나를 취할 때, 중국 검열에 대한 준수율은 위반률 17%에서 85%로 증가하고, 거짓 응답률은 63-69%에서 22%로 감소합니다. 반면 Kimi K3는 행동 변화가 거의 없습니다. Alibaba Qwen3-235B, Meta Llama 3.3-70B, Google Gemma 3-27B, OpenAI GPT-5.2, Anthropic Claude Sonnet-4.6과 같은 다른 모델들도 다양한 성공률로 대체 정체성을 채택합니다. 연구자들은 자기 식별이 어느 정도 행동에 영향을 미치지만 강한 상관관계는 아니며, "클로드 자기 인식이 이러한 모델들의 가중치에 내장되어 있다"고 결론짓습니다.
출처: 3DNews — 원문
관련 게시물 ↓
새로운 뉴스