Chinese Academy of Sciences Solves AI's Most Embarrassing Problem: Social Intelligence
Институт вычислительных технологий Китайской академии наук (Institute of Computing Technology, Chine
The Chinese Academy of Sciences (CAS) has unveiled a social intelligence technology system called Zhijing, which includes the SoMBench benchmark, the Zing training system, and the Actio deployment architecture. The system aims to fill the gap in social perception of large language models, making them more empathetic and reliable.
중국과학원 계산기술연구소의 Zhijing 팀은 대규모 언어 모델의 사회적 인지(social cognition) 결핍을 해결하기 위해 설계된 Zhijing 사회 지능 기술 시스템을 공식 발표했습니다. 이 시스템은 세 가지 핵심 구성 요소인 벤치마크 SoMBench(Social Mind Benchmark), 훈련 시스템 Zing 및 배포 아키텍처 Actio를 포함합니다. SoMBench는 추상적인 '사람 이해' 개념을 3개 차원, 17개 하위 차원 및 71개 작업으로 분해하며, 전문가가 선별하고 검증한 3481개의 예제를 사용합니다. 이는 전체 점수를 평가할 뿐만 아니라 모델의 특정 오류(예: 추론 체인 중단 또는 표면 패턴 추측)를 지적할 수 있습니다. 20개의 주요 LLM을 테스트한 결과, 최고 모델의 점수는 72.08%에 불과했으며, 어떤 모델도 90% 임계값에 도달하지 못하여 작업의 난이도를 확인했습니다. 훈련 시스템 Zing은 세 가지 핵심 메커니즘을 사용합니다. FLARE(Flying Data Wheel)는 모델의 특정 약점을 대상으로 새로운 훈련 예제를 생성합니다. 2단계 훈련(먼저 증류 및 동적 보상이 있는 GRPO를 통한 일반 사회 지능, 그다음 SFT 및 복잡한 예제를 통한 보정을 통한 전문 기술 강화), OPD(On-Policy Distillation)는 새로운 지식을 배우면서 이전 지식을 유지하여 파괴적 망각을 방지합니다. 결과는 인상적입니다. 멀티모달 모델 Zing-27B는 5개 국제 벤치마크 평균에서 GPT-5.5를 능가했습니다(79.80 대 78.44). 특히 HiToM에서 +4.08%p, EmoBench에서 +5.62%p의 큰 차이를 보였습니다. 텍스트 모델 Zing-32B는 DeepSeek-V4-Pro를 약간 앞질렀으며(76.32 대 75.90), 특히 EmoBench에서 78.13 대 71.88로 우세했습니다. 소형 모델 Zing-8B 및 Zing-14B는 HiToM에서 기본 모델에 비해 상당한 개선을 보였으며 훨씬 더 큰 파라미터 수를 가진 모델의 성능을 초과했습니다. Actio 배포 아키텍처는 작업에 따라 PRISM, Starling Memory, SAGE, Gated RAG의 네 가지 지원 유형을 선택적으로 활성화하여 모델이 단순히 '생각'하는 것이 아니라 실제 시나리오에서 올바르게 행동할 수 있도록 합니다. 이 시스템은 구현된 지능(로봇 도우미, 동반자), 복잡한 의사 결정(정책, 위기 관리) 및 인간-기계 상호 작용(여러 에이전트를 위한 통합 사회 인식 프로토콜)에 적용될 수 있습니다. 팀은 GitHub에서 벤치마크와 모델 가중치를 오픈소스로 공개할 계획입니다.
출처: QbitAI 量子位 —
원문
