Google、Gemini Robotics 2.0を発表、器用さと安全性の向上を約束
Google/DeepMind
Google DeepMindは、ロボット制御のための新しいモデル群であるGemini Robotics 2.0を発表しました。これにより、ロボットはより複雑なタスクを実行し、変化する環境を分析し、他のロボットと相互作用できるようになります。主要コンポーネントであるGemini Robotics ER 2は、Gemini Live APIを通じて開発者に提供され、前バージョンと比較してビデオ理解が大幅に向上しています。
Googleは、ロボットがより複雑なタスクを実行し、変化する環境を分析し、他のロボットと協力することを可能にするモデル群であるGemini Robotics 2.0を発表しました。その中心となるのが、前バージョンの1.6から大幅に改良された、embodied reasoning(身体化推論)モデル「Gemini Robotics ER 2」です。このモデルはGemini Live APIと統合されており、開発者はその機能を活用できます。ER 2はvision language model(VLM、視覚言語モデル)であり、ロボットのカメラからのライブ映像ストリームを処理して進捗状況を追跡できます。Googleは、ER 2がビデオクリップの完全性をほぼ60%の精度で分類できると主張しており、これは競合するAIモデルよりも優れています。このプロジェクトの目標は、人間のあらゆる行動を実行できる汎用ロボット、いわゆる「物理的AGI(汎用人工知能)」を構築することです。
出典: Ars Technica —
原文
