研究モデル 🇨🇳 27.07.2026 09:03

Chinese Academy of Sciences Solves AI's Most Embarrassing Problem: Social Intelligence

Институт вычислительных технологий Китайской академии наук (Institute of Computing Technology, ChineИнститут вычислительных технологий Китайской академии наук (Institute of Computing Technology, Chine
The Chinese Academy of Sciences (CAS) has unveiled a social intelligence technology system called Zhijing, which includes the SoMBench benchmark, the Zing training system, and the Actio deployment architecture. The system aims to fill the gap in social perception of large language models, making them more empathetic and reliable.
中国科学院计算技术研究所的智境团队正式发布了智境社会智能技术体系,旨在弥补大语言模型在社会认知方面的不足。该系统包含三个关键组件:基准测试SoMBench(Social Mind Benchmark)、训练系统Zing和部署架构Actio。SoMBench将“理解他人”这一抽象概念拆解为3个维度、17个子维度和71项任务,使用3481个精心挑选并经专家验证的样本;它不仅能给出总分,还能指出模型的具体错误(例如推理链断裂或依赖表面模式猜测)。对20个主流LLM的测试显示,最佳模型得分仅为72.08%,无一达到90%的阈值,体现了任务的复杂性。训练系统Zing采用三种关键机制:FLARE——“数据飞轮”,针对模型的具体短板生成新训练样本;两阶段训练(先通过蒸馏和动态奖励GRPO训练通用社会智能,再通过SFT和难例校准增强专门技能);以及OPD(On-Policy Distillation)——在学习新知识时保留旧知,防止灾难性遗忘。结果令人瞩目:多模态模型Zing-27B在五个国际基准测试均值上超越GPT-5.5(79.80对78.44),在HiToM(高出4.08个百分点)和EmoBench(高出5.62个百分点)上优势最大。纯文本模型Zing-32B略胜DeepSeek-V4-Pro(76.32对75.90),尤其在EmoBench上(78.13对71.88)。小模型Zing-8B和Zing-14B在HiToM上相比基准模型有显著提升,甚至超越了参数规模大得多的模型。部署架构Actio可根据任务选择性激活四种支持类型(PRISM、Starling Memory、SAGE、Gated RAG),使模型不仅会“思考”,还能在实际场景中正确行动。该系统可应用于具身智能(机器人助手、伴侣)、复杂决策(政策、危机管理)和人机交互(多智能体统一社会意识协议)。团队计划在GitHub上开源基准测试和模型权重。
出典: QbitAI 量子位 — 原文
関連記事 ↓
新着ニュース