Gemini Robotics 2 Traz Inteligência Corporal Completa para Robôs
Google/DeepMind
DeepMind
O Google DeepMind apresenta o Gemini Robotics 2, um conjunto de modelos de IA que permite controle corporal total, destreza e colaboração entre múltiplos robôs para robôs adaptáveis. Os modelos incluem um modelo visão-linguagem-ação (VLA), um modelo de raciocínio incorporado (ER) e um VLA no dispositivo, suportando tarefas desde a caminhada humanoide até a manipulação delicada.
O Google DeepMind anunciou o Gemini Robotics 2, uma nova camada de inteligência para robôs que possibilita controle corporal total, destreza fina e colaboração multi-robô. O sistema inclui três modelos: Gemini Robotics 2, um modelo de visão-linguagem-ação (VLA - vision-language-action model) para controle motor; Gemini Robotics ER 2, um modelo de raciocínio incorporado para planejamento e comunicação; e Gemini Robotics On-Device 2, um VLA eficiente otimizado para execução local. Esses modelos podem controlar robôs humanoides como o Apollo 2, da Apptronik, dos pés às pontas dos dedos, realizar tarefas delicadas como amarrar nós com uma mão de cinco dedos e permitir trabalho em equipe multi-robô. O modelo ER está disponível no Google AI Studio e em pré-visualização privada no Gemini Enterprise Agent Platform, enquanto os modelos VLA e on-device são para parceiros de acesso antecipado. As medidas de segurança incluem o benchmark ASIMOV-Agentic para chamadas seguras de ferramentas e detecção de proximidade humana. Este trabalho marca um marco em direção à inteligência física de propósito geral.
Fonte: Google DeepMind —
original
