Google présente Gemini Robotics 2.0, promettant une dextérité et une sécurité améliorées
Google/DeepMind
Google DeepMind a présenté Gemini Robotics 2.0, un ensemble de nouveaux modèles pour le contrôle de robots, qui permet aux robots d'effectuer des tâches plus complexes, d'analyser des environnements changeants et d'interagir avec d'autres robots. Le composant clé, Gemini Robotics ER 2, est disponible pour les développeurs via l'API Gemini Live et montre une amélioration significative de la compréhension vidéo par rapport à la version précédente.
Google a présenté Gemini Robotics 2.0, un ensemble de modèles qui permettent aux robots d'effectuer des tâches plus complexes, d'analyser un environnement changeant et de collaborer avec d'autres robots. À la base se trouve un modèle de raisonnement incarné nommé Gemini Robotics ER 2, qui constitue une amélioration significative par rapport à la version précédente 1.6. Ce modèle est intégré à l'API Gemini Live, ce qui permet aux développeurs d'exploiter ses capacités. ER 2 est un modèle de vision-langage (VLM) capable de traiter des flux vidéo en direct provenant des caméras du robot pour suivre la progression. Google affirme qu'ER 2 peut classer l'exhaustivité des segments vidéo avec une précision de près de 60 %, ce qui est meilleur que les modèles d'IA concurrents. L'objectif du projet est de créer un robot universel capable d'effectuer toutes les actions humaines, parfois appelé « AGI physique ».
Source: Ars Technica —
original
