Gemini Robotics ER 2: impulsionando robótica com compreensão de vídeo, orquestração de tarefas e colaboração multi-robô
Google/DeepMind
Boston Dynamics
O Google DeepMind lançou o Gemini Robotics ER 2, um novo modelo de raciocínio incorporado para robótica. Ele permite compreensão de vídeo em tempo real, planejamento de tarefas de múltiplas etapas e colaboração multi-robô, e está disponível via API Gemini e Google AI Studio.
O Google DeepMind apresentou o Gemini Robotics ER 2, um modelo de raciocínio incorporado para robótica que atua como um cérebro de alto nível para robôs. Ele pode conversar com humanos, compreender o mundo físico, planejar tarefas de múltiplas etapas e delegar a execução motora a modelos de visão-linguagem-ação (vision-language-action, VLA) de nível inferior. O modelo chama nativamente ferramentas como a Pesquisa Google ou funções definidas pelo usuário. Ele melhora em relação ao ER 1.6 ao processar feeds de vídeo contínuos para acompanhar o progresso, se adaptar a falhas e determinar a conclusão de tarefas. A colaboração multi-robô é introduzida, permitindo que robôs diversos trabalhem juntos. O Gemini Robotics ER 2 alcança 57,4% de precisão na classificação de progresso e 91,3% de precisão em tarefas de encontrar momentos, com latência inferior a um segundo. Ele supera modelos anteriores em benchmarks de segurança, incluindo a parada de um robô humanoide quando uma pessoa está por perto. O modelo está disponível publicamente por meio da API Gemini, do Google AI Studio e em pré-visualização privada no Gemini Enterprise Agent Platform.
Fonte: Google DeepMind —
original
