研究模型 🇨🇳 27.07.2026 09:03

中科院解决AI最尴尬问题:社交智能

Институт вычислительных технологий Китайской академии наук (Institute of Computing Technology, ChineИнститут вычислительных технологий Китайской академии наук (Institute of Computing Technology, Chine
中国科学院发布了名为“智境”的社交智能技术系统,包括SoMBench基准测试、Zing训练系统和Actio部署架构。该系统旨在填补大语言模型在社交感知方面的空白,使其更具共情能力和可靠性。
中国科学院计算技术研究所的智境团队正式发布了智境社会智能技术体系,旨在弥补大语言模型在社会认知方面的不足。该系统包括三个关键组件:基准测试SoMBench(Social Mind Benchmark)、训练系统Zing和部署架构Actio。SoMBench将抽象的“理解他人”概念拆解为3个维度、17个子维度和71项任务,使用了3481个精心筛选并由专家验证的示例;它不仅能评估总体得分,还能指出模型的具体错误(例如推理链断裂或根据表面模式猜测)。对20个领先大语言模型的测试表明,最佳模型仅获得72.08%的分数,没有模型达到90%的阈值,这证实了任务的难度。训练系统Zing采用了三个关键机制:FLARE(即“飞行数据轮”),它生成针对模型特定缺陷的新训练示例;两阶段训练(首先通过蒸馏和基于动态奖励的GRPO(组相对策略优化)学习通用社会智能,然后通过SFT(监督微调)和困难示例校准来增强专门技能);以及OPD(即在线策略蒸馏),在掌握新知识的同时保留旧知识,防止灾难性遗忘。结果令人印象深刻:多模态模型Zing-27B在五项国际基准测试的平均分上超越了GPT-5.5(79.80分对78.44分),在HiToM(+4.08个百分点)和EmoBench(+5.62个百分点)上领先幅度最大。文本模型Zing-32B略微领先DeepSeek-V4-Pro(76.32分对75.90分),尤其在EmoBench上表现突出(78.13分对71.88分)。小型模型Zing-8B和Zing-14B在HiToM上相比基础模型有显著提升,甚至超过了参数量大得多的模型。部署架构Actio根据任务选择性地激活四种支持类型(PRISM、Starling Memory、SAGE、Gated RAG),使模型不仅在思考层面,还能在真实场景中正确行动。该系统可应用于具身智能(如机器人助手、伴侣)、复杂决策(如政策制定、危机管理)和人机交互(多个智能体的统一社会意识协议)。团队计划在GitHub上开源基准测试和模型权重。
来源: QbitAI 量子位 — 原文
我们之前关于此话题的帖子 ↓
最新新闻