Chinese Academy of Sciences Solves AI's Most Embarrassing Problem: Social Intelligence
Институт вычислительных технологий Китайской академии наук (Institute of Computing Technology, Chine
The Chinese Academy of Sciences (CAS) has unveiled a social intelligence technology system called Zhijing, which includes the SoMBench benchmark, the Zing training system, and the Actio deployment architecture. The system aims to fill the gap in social perception of large language models, making them more empathetic and reliable.
中国科学院计算技术研究所的智竞团队正式发布了名为“智竞社会智能”的技术体系,旨在弥补大型语言模型在社会认知方面的不足。该系统包含三个核心组件:SoMBench基准(Social Mind Benchmark)、Zing训练系统和Actio部署架构。SoMBench将抽象的“理解他人”概念细化为3个维度、17个子维度和71项任务,使用3481个精心挑选且经专家验证的实例;它不仅能评估总体得分,还能指出模型的具体错误(例如推理链断裂或基于表面模式猜测)。对20个领先LLM的测试显示,最佳模型仅得72.08%,无模型达到90%阈值,证实了任务的难度。Zing训练系统采用三个关键机制:FLARE——“飞轮数据”,生成针对模型特定弱点的新训练样本;两阶段训练(先通过蒸馏和带动态奖励的GRPO学习通用社会智能,再通过SFT和困难样本校准强化专业技能);以及OPD(On-Policy Distillation)——在学习新知识时保留旧知识,防止灾难性遗忘。结果令人印象深刻:多模态模型Zing-27B在五个国际基准的平均值上超越GPT-5.5(79.80比78.44),在HiToM(+4.08个百分点)和EmoBench(+5.62个百分点)上优势最大。文本模型Zing-32B略胜DeepSeek-V4-Pro(76.32比75.90),尤其在EmoBench上(78.13比71.88)。小模型Zing-8B和Zing-14B在HiToM上相比基础模型有显著提升,甚至超过了参数数量大得多的模型。Actio部署架构可根据任务选择性地激活四种支持类型(PRISM、Starling Memory、SAGE、Gated RAG),使模型不仅“思考”,还能在真实场景中正确行动。该系统可应用于具身智能(辅助机器人、伴侣机器人)、复杂决策(政策制定、危机管理)和人机交互(多智能体共享社会意识协议)。团队计划在GitHub上开源基准测试和模型权重。
स्रोत: QbitAI 量子位 —
मूल
