Tại sao robot vẫn mắc kẹt trong demo? Công ty mới của iFlytek đưa ra câu trả lời: thiếu 'nhận thức cơ thể'
科大讯飞
NVIDIA
iFlytek đã thành lập một công ty mới, Yaofang Intelligent, để phát triển 'bộ não' cho trí tuệ nhập thể. Công ty cho rằng kiến trúc VLA chủ đạo không phải là giải pháp cuối cùng, và các mô hình thế giới cần một thành phần chủ chốt: 'nhận thức cơ thể' - khả năng robot hiểu về khả năng vật lý của chính nó. Mô hình của họ, iFLYTEK-Embodied-Omni, tích hợp sinh video, động học ngược và bộ não 'lõi kép' để đạt tỷ lệ thành công cao hơn trong các chuẩn đánh giá tổng quát.
科大讯飞悄然注册了一家新公司——安徽耀方智能科技有限公司,注册资本3亿元,由科大讯飞首席科学家、国家科技进步一等奖核心骨干潘嘉领衔。该公司专注于为机器人构建‘大脑’,认为当前主流的VLA(视觉-语言-动作)架构并非终极方案,因为它缺乏后果预测能力。他们提出世界模型需要额外组件:‘身体认知’——即机器人理解自身物理限制的能力。团队发布技术报告《iFLYTEK-Embodied-Omni》,介绍了一种统一的多模态具身基础模型,该模型结合了VLM(视觉-语言模型)、VGM(视频生成模型)和AGM(动作生成模型),并采用共享的多模态自注意力机制。模型将逆运动学作为训练任务以增强身体认知。在基准测试中,该模型在LIBERO-Plus零样本泛化任务中平均成功率达到89.6%,在RoboTwin 2.0双臂任务中超过93%。公司计划与科大讯飞子公司灵动机器人集成,将‘大脑’部署到真实机器人中。
Nguồn: QbitAI 量子位 —
bản gốc
