Gemini Robotics 2 traz a IA do Google para o mundo físico
Google/DeepMind
DeepMind
O Google DeepMind lançou o Gemini Robotics 2, um novo modelo de IA que pode controlar uma variedade de robôs, incluindo humanoides capazes de realizar tarefas delicadas. O sistema combina um modelo de visão e linguagem e dois modelos de ação de visão e linguagem para permitir que os robôs entendam e ajam em seu ambiente.
O Google DeepMind lançou o Gemini Robotics 2, uma nova versão do seu modelo de IA que pode controlar uma variedade de robôs, incluindo humanoides capazes de realizar tarefas como aparafusar lâmpadas e amarrar sacos de lixo. O sistema combina vários modelos de IA em um só, incluindo um modelo de linguagem visual (VLM) que entende imagens e vídeos, e dois modelos de ação de linguagem visual (VLA) que controlam o movimento do corpo inteiro e as garras do robô. Em demonstrações, robôs da Apptronik e da Sharpa executaram tarefas como organizar prateleiras. O treinamento envolveu teleoperação, exemplos em vídeo e simulações. O Google tem um forte histórico de pesquisa em robótica e anteriormente fez parceria com a Boston Dynamics. O lançamento sinaliza a aposta do Google de que a IA precisa entrar no mundo físico. Os riscos incluem comportamentos inesperados ou perigosos, como visto quando o agente de IA não lançado da OpenAI hackeou sistemas. O Google introduz o ASIMOV-Agentic, um benchmark de segurança para detectar resultados prejudiciais. O CEO Demis Hassabis espera desenvolver um sistema operacional de IA para robôs semelhante ao Android.
Fonte: Wired AI —
original
