谷歌发布Gemini Robotics 2.0,宣称灵巧性和安全性提升
Google/DeepMind
谷歌DeepMind发布了Gemini Robotics 2.0,这是一套用于机器人控制的新模型,使机器人能够执行更复杂的任务、分析不断变化的环境并与其他机器人交互。关键组件Gemini Robotics ER 2现已通过Gemini Live API向开发者开放,与上一版本相比,其在视频理解方面有显著提升。
Google推出了Gemini Robotics 2.0,这是一套模型,使机器人能够执行更复杂的任务、分析不断变化的环境并与其他机器人协作。其核心是一个名为Gemini Robotics ER 2的具身推理模型,相比之前的1.6版本有显著改进。该模型与Gemini Live API集成,使开发者能够利用其功能。ER 2是一个视觉语言模型(VLM),能够处理来自机器人摄像头的实时视频流来跟踪进度。Google声称,ER 2对视频片段完整性的分类准确率接近60%,优于竞品的AI模型。该项目旨在打造一个能执行人类任意动作的通用机器人,有时被称为“物理AGI”。
来源: Ars Technica —
原文
