ModèlesRobotique 🇺🇸 30.07.2026 18:01

Gemini Robotics ER 2 : la robotique boostée par la compréhension vidéo, l'orchestration de tâches et la collaboration multi-robot

Google/DeepMindGoogle/DeepMind Boston DynamicsBoston Dynamics
Google DeepMind a lancé Gemini Robotics ER 2, un nouveau modèle de raisonnement incarné pour la robotique. Il permet la compréhension vidéo en temps réel, la planification de tâches en plusieurs étapes et la collaboration multi-robot, et est disponible via l'API Gemini et Google AI Studio.
Google DeepMind a présenté Gemini Robotics ER 2, un modèle de raisonnement incarné pour la robotique qui sert de cerveau de haut niveau pour les robots. Il peut dialoguer avec des humains, comprendre le monde physique, planifier des tâches en plusieurs étapes et déléguer l'exécution motrice à des modèles vision-langage-action (vision-language-action, VLA) de plus bas niveau. Le modèle utilise nativement des outils comme Google Search ou des fonctions définies par l'utilisateur. Il améliore ER 1.6 en traitant des flux vidéo continus pour suivre la progression, s'adapter aux échecs et déterminer l'achèvement des tâches. La collaboration multi-robots est introduite, permettant à divers robots de travailler ensemble. Gemini Robotics ER 2 atteint une précision de 57,4 % sur la classification de progression et de 91,3 % sur les tâches de recherche de moments avec une latence inférieure à la seconde. Il surpasse les modèles précédents sur les benchmarks de sécurité, notamment en arrêtant un robot humanoïde lorsqu'une personne se trouve à proximité. Le modèle est disponible publiquement via l'API Gemini, Google AI Studio, et en aperçu privé sur la plateforme Gemini Enterprise Agent.
Source: Google DeepMind — original
Nos articles précédents sur ce sujet ↓
Infos fraîches