Google presenta Gemini Robotics 2.0, prometiendo una mejor destreza y seguridad
Google/DeepMind
Google DeepMind ha presentado Gemini Robotics 2.0, un conjunto de nuevos modelos para el control de robots que permite a los robots realizar tareas más complejas, analizar entornos cambiantes e interactuar con otros robots. El componente clave, Gemini Robotics ER 2, está disponible para desarrolladores a través de la API Gemini Live y demuestra una mejora significativa en la comprensión de video en comparación con la versión anterior.
Google ha presentado Gemini Robotics 2.0, un conjunto de modelos que permiten a los robots realizar tareas más complejas, analizar entornos cambiantes y colaborar con otros robots. En su núcleo se encuentra un modelo de razonamiento encarnado llamado Gemini Robotics ER 2, que supone una mejora significativa respecto a la versión anterior, la 1.6. Este modelo está integrado con la API de Gemini Live, lo que permite a los desarrolladores aprovechar sus capacidades. ER 2 es un modelo de lenguaje y visión (VLM, por sus siglas en inglés), capaz de procesar flujos de video en vivo desde las cámaras del robot para supervisar el progreso. Google afirma que ER 2 puede clasificar la completitud de fragmentos de video con una precisión de casi el 60 por ciento, superando a otros modelos de inteligencia artificial competidores. El objetivo del proyecto es crear un robot universal capaz de realizar cualquier acción humana, algo que a veces se denomina 'AGI físico'.
Fuente: Ars Technica —
original
