Gemini Robotics 2 将谷歌的人工智能带入物理世界
Google/DeepMind
DeepMind
谷歌 DeepMind 发布了 Gemini Robotics 2,这是一个新的人工智能模型,能够控制多种机器人,包括能够执行灵巧任务的人形机器人。该系统结合了一个视觉语言模型和两个视觉语言动作模型,使机器人能够理解并在其环境中采取行动。
谷歌DeepMind发布了Gemini Robotics 2,这是其AI模型的新版本,能够控制一系列机器人,包括能够完成拧灯泡和系垃圾袋等任务的人形机器人。该系统将多个AI模型整合为一体,其中包括一个理解图像和视频的视觉语言模型(VLM),以及两个控制机器人全身运动和夹爪的视觉语言动作(VLA)模型。在演示中,来自Apptronik和Sharpa的机器人执行了整理货架等任务。训练过程涉及远程操作、视频示例和模拟。谷歌在机器人研究方面有着深厚的积累,此前曾与波士顿动力公司合作。此次发布标志着谷歌押注AI必须进入物理世界。风险包括意外或危险行为,正如OpenAI未发布的AI代理入侵系统时所展示的那样。谷歌推出了ASIMOV-Agentic,这是一个用于检测有害结果的安全基准。首席执行官德米斯·哈萨比斯希望开发一种类似安卓的机器人AI操作系统。
来源: Wired AI —
原文
