Dyna Robotics 发布 Dyna-2 世界动作模型,预训练数据达百万小时人类视频
Dyna Robotics 推出了 Dyna-2,这是一个用于机器人操作的世界动作模型,其预训练使用了超过一百万小时的自我中心视角人类视频。该模型在人类数据上展示了缩放定律,能够零样本迁移到未见过的机器人数据,并证明了视频预测驱动跨实体泛化。Dyna-2 仅作为供应商运营的 Dyna 机器人单元的一部分提供,没有公开的检查点、应用程序接口或许可证。
Dyna Robotics推出了Dyna-2,一种专为机器人操作设计的“世界-动作模型”,它基于超过一百万小时的第一人称视角人类视频进行预训练,这相当于大约170年的连续清醒体验。该模型采用了一种混合Transformer架构,对视频和动作分别进行词元化和处理,并采用了基于流匹配的视频扩散骨干网络。公司报告了三个关键的扩展性结果:在人类数据上,扩展定律成立,直至一百万小时;该定律可以零样本迁移到39个任务中的未见过的机器人数据上;视频预测(而非动作数据)驱动了跨实体泛化。在三个实体上的14个任务中进行的机器人后训练显示,平均归一化分数从数据阶梯中的20%提高到53%,具体改进包括“锁盒钥匙转动”达到90%的成功率。Dyna-2不作为可下载权重提供;部署需要购买Dyna机器人单元。该模型在机器人实测和未见过的客户现场中均优于公司生产的VLA——Dyna-1,在这些现场中,它以87%的概率通过了生产标准,而Dyna-1只有46%。技术报告可供进一步阅读。
来源: MarkTechPost —
原文
