机器人模型 🇨🇳 05.08.2026 11:01

谷歌推出三款新模型,将机器人打造成“全能打工人”:快速适应、全身控制、团队协作

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
谷歌深度思维于7月30日发布了Gemini Robotics 2,这是一套由三款人工智能模型组成的套件,可实现人形机器人及其他机器人的全身控制、高级灵巧操作以及多机器人协作。这些模型包括一个用于全身控制的视觉-语言-动作(VLA)模型、一个用于规划与协作的具身推理视觉-语言模型(VLM),以及一个用于快速适应的设备端模型。谷歌通过一项名为ASIMOV-Agentic的新基准测试来强调安全性。
7月30日,谷歌DeepMind推出了Gemini Robotics 2,这是其AI模型系列的新版本,旨在控制各类机器人(包括人形机器人),使它们能够自主适应不可预测的环境,并对每一个动作进行推理,从而解锁清洁垃圾、拿起洒水壶等广泛任务。此次更新增加了智能全身控制、先进灵巧性和多机器人协作能力,标志着机器人技术进入新阶段。此前,Gemini Robotics系统可以驱动机器人完成封袋、折纸等精细操作,但仅限于机械臂和机械手。新模型可以在设备上运行,并在数小时内适应全新的机器人本体,将学习到的技能在不同平台上迁移。它们还能让不同的机器人协同工作,更快地完成任务。谷歌将此视为迈向物理AGI(通用人工智能)的里程碑,届时机器人可以完成人类能做的任何事情。演示视频展示了Apptronik Apollo 2人形机器人遵循指令,例如将洒水壶放在绿色盒子上,以及机器人执行将书籍放到书架上、整理板子、将磁带放入收音机等任务。该系统支持高度灵巧的五指手,例如Apollo 2上的22自由度SharpaWave手,可执行打结、封拉链袋等任务,也支持标准的两指夹爪,例如Franka Duo。谷歌报告称,在三种全身操控类别中,成功率在45.7%至76.3%之间;在三种Franka Duo夹爪类别中,成功率为74.2%至89.6%;在多指任务中,成功率在32%至92%之间。视频展示了完全自主的机器人,这与埃隆·马斯克的Optimus形成对比,据报道后者使用了远程操作员。然而,这些机器人并非通用型;每项任务都通过遥操作、视频示例和模拟进行专门训练。谷歌的方法涉及三个不同的模型:Gemini Robotics 2,这是一个视觉-语言-动作(VLA)模型,将视觉和语言输入转换为电机控制,用于全身控制;Gemini Robotics ER 2,这是一个具身推理视觉-语言模型(VLM),充当大脑代理,用于通信、规划多步骤任务和实现机器人团队协作;以及Gemini Robotics On-Device 2,这是一个VLA模型,用于本地执行,能快速适应新的机器人本体,继承自Gemini Robotics 1.5。为了确保安全,谷歌引入了ASIMOV-Agentic,这是一个用于代理安全编排和不确定性解决的基准,衡量代理拒绝不安全工具调用和预测任务完成的能力。Gemini Robotics ER 2是目前最安全的机器人模型,能够检测到人的接近并据此停止机器人。该软件运行在机器人本体上,其中许多是在中国制造的,尽管美国最近限制了中国制造的机器人。
来源: InfoQ 中国 — 原文
我们之前关于此话题的帖子 ↓
最新新闻