机器人脑力竞赛进入深水区:物理世界需要从零设计模型
在2025年世界人工智能大会上,具身智能成为焦点,超过200家公司参展,关注点从性能机器人转向实际应用,如搬运和检测。蚂蚁灵波首席科学家沈宇军认为,通过微调将数字世界的视频模型适配到机器人是一种路径依赖的捷径,而非最终解决方案,倡导一种“具身原生”的方法,即为物理现实从头设计模型。该公司发布了全栈大脑2.0,包含六个模型,包括业界首个具身原生世界动作模型,并宣布了一轮融资,目标是筹集15亿元人民币。
在WAIC的采访中,蚂蚁灵波的首席科学家沈宇军讨论了具身智能的挑战,强调数据标准尚未统一,因为技术路线仍未确定,在模态、精度或质量上尚无共识。他指出,对于通用机器人而言,真实数据,尤其是来自机器人的遥操作数据和来自人类的第一人称数据,比仿真数据更为关键,因为仿真难以复现人类的潜意识行为。灵波的策略是开发多种模型(如LingBot-Vision、LingBot-Depth、LingBot-Video、LingBot-VLA和LingBot-VA)来解决特定的技术问题,例如模态对齐、动态预测以及确保专家混合(MoE)架构中的负载均衡,而不是过早尝试单一的端到端模型。沈宇军引入了“具身原生”模型的概念,要求数据源自物理世界任务,模型能力适合实时交互,并能够从头开始训练,他还指出了复现像DINO这样的自监督视觉模型以及实现单向注意力的因果建模的困难。在安全方面,他强调“围栏式”安全(限制动作)是不够的,主张在预训练阶段嵌入“原生安全”,类似于人类的本能。他还预测,当普通人能够轻松参与数据收集时,具身人工智能的“ChatGPT时刻”将会到来,使机器人真正有益并融入日常生活。
来源: InfoQ 中国 —
原文
