Gemini Robotics 2 apporte l’intelligence du corps entier aux robots
Google/DeepMind
DeepMind
Google DeepMind présente Gemini Robotics 2, une suite de modèles d’IA permettant le contrôle du corps entier, la dextérité et la collaboration multi-robots pour des robots adaptables. Les modèles incluent un modèle vision-langage-action (VLA), un modèle de raisonnement incarné (ER) et un VLA sur appareil, prenant en charge des tâches allant de la marche humanoïde à la manipulation délicate.
Google DeepMind a dévoilé Gemini Robotics 2, une nouvelle couche d'intelligence pour robots permettant le contrôle du corps entier, une dextérité fine et la collaboration multi-robot. Le système comprend trois modèles : Gemini Robotics 2, un modèle vision-langage-action (VLA) pour le contrôle moteur ; Gemini Robotics ER 2, un modèle de raisonnement incarné pour la planification et la communication ; et Gemini Robotics On-Device 2, un VLA efficace optimisé pour une exécution locale. Ces modèles peuvent contrôler des robots humanoïdes comme l'Apollo 2 d'Apptronik, des pieds aux doigts, effectuer des tâches délicates comme faire des nœuds avec une main à cinq doigts, et permettre un travail d'équipe multi-robot. Le modèle ER est disponible sur Google AI Studio et en aperçu privé sur Gemini Enterprise Agent Platform, tandis que les modèles VLA et on-device sont destinés aux partenaires en accès anticipé. Les mesures de sécurité incluent le benchmark ASIMOV-Agentic pour les appels d'outils sécurisés et la détection de proximité humaine. Ces travaux marquent une étape importante vers l'IA physique à usage général.
Source: Google DeepMind —
original
