机器人为何停滞于演示阶段?科大讯飞新公司解答:缺乏“本体认知”
科大讯飞
NVIDIA
科大讯飞旗下的新公司瑶方智能解释称,机器人的主要问题不在于速度,而在于缺乏“本体认知”。他们提出了自己的架构iFLYTEK-Embodied-Omni,该架构集成了VLM(视觉语言模型)、VGM(视觉生成模型)和AGM(动作生成模型),以克服VLA(视觉语言动作)的局限并弥补真实数据的不足。该架构已在包括LIBERO-Plus和RoboTwin 2.0在内的基准测试中展现出高性能。
在WAIC 2026展会上,科大讯飞(中国)通过子公司安徽爻方智能展示了一种构建机器人“大脑”的新方法。据负责人潘嘉介绍,当前的演示机器人运行缓慢并非技术限制所致,而是源于对错误的担忧:速度可以提升,但这样会增加故障概率,这在现实应用中是不可接受的。潘嘉是科大讯飞首席科学家、国家科技进步一等奖获得者。他声称,主流的VLA(视觉-语言-动作)架构并非最终解决方案,而世界模型存在两个缺陷:一是序列预测中的误差累积,二是缺乏“本体认知”。爻方智能提出了自己的iFLYTEK-Embodied-Omni系统,其中VLM(视觉语言模型,用于理解与规划)、VGM(视频生成模型,用于预测)和AGM(动作生成模型)通过共同的注意力机制协同工作。关键创新在于将逆运动学任务作为训练的一部分,使模型学会理解自身身体的能力。同时,近一半的训练数据是空间感知与规划的合成数据,而非真实的机器人记录。在LIBERO-Plus基准测试中,该模型平均成功率达89.6%;在RoboTwin 2.0标准环境下为93.68%,随机环境下为93.16%。公司已在子公司安徽灵动通用机器人公司的真实机器人上进行了系统测试。“爻方”一名寓意“变化与稳定”:第一个字“爻”象征变化(阴阳),第二个字“方”代表稳定。相关论文已在arXiv上发布。
来源: QbitAI 量子位 —
原文
