RobóticaModelos 🇨🇳 05.08.2026 11:01

Google lanza tres nuevos modelos para convertir robots en 'trabajadores polivalentes': adaptación rápida, control de cuerpo completo y colaboración en equipo

Google/DeepMindGoogle/DeepMind Google DeepMindGoogle DeepMind
Google DeepMind anunció Gemini Robotics 2 el 30 de julio, un conjunto de tres modelos de IA que permiten el control de cuerpo completo, destreza avanzada y colaboración multi-robot para humanoides y otros robots. Los modelos incluyen un modelo VLA para control de cuerpo completo, un VLM de razonamiento encarnado para planificación y colaboración, y un modelo local al dispositivo para adaptación rápida. Google enfatiza la seguridad con un nuevo punto de referencia llamado ASIMOV-Agentic.
El 30 de julio, Google DeepMind presentó Gemini Robotics 2, una nueva versión de su serie de modelos de IA diseñada para controlar varios robots, incluidos los humanoides, permitiéndoles adaptarse autónomamente a entornos impredecibles y razonar sobre cada acción, desbloqueando así una amplia gama de tareas como limpiar basura y recoger una regadera. La actualización añade control inteligente de todo el cuerpo, destreza avanzada y colaboración multi-robot, marcando una nueva fase en robótica. El sistema anterior Gemini Robotics podía hacer que los robots realizaran operaciones finas como sellar bolsas y doblar origami, pero solo con brazos y manos robóticas. Los nuevos modelos pueden ejecutarse en el dispositivo y adaptarse a cuerpos de robot completamente nuevos en cuestión de horas, transfiriendo habilidades aprendidas entre diferentes plataformas. También permiten que diferentes robots trabajen juntos para completar tareas más rápido. Google ve esto como un hito hacia la AGI física, donde los robots pueden hacer cualquier cosa que un humano pueda hacer. Los videos de demostración muestran al humanoide Apptronik Apollo 2 siguiendo comandos como colocar una regadera sobre una caja verde, y robots realizando tareas como colocar libros en estantes, ordenar tableros y poner cintas en una radio. El sistema admite manos de cinco dedos altamente diestras, como la mano SharpaWave de 22 grados de libertad en Apollo 2, realizando tareas como atar nudos y sellar bolsas con cremallera, así como pinzas estándar de dos dedos como la Franka Duo. Google reporta tasas de éxito entre 45.7% y 76.3% para tres categorías de manipulación de cuerpo completo, 74.2% a 89.6% para tres categorías de pinza Franka Duo, y 32% a 92% para tareas con múltiples dedos. Los videos muestran robots totalmente autónomos, en contraste con el Optimus de Elon Musk que supuestamente usaba operadores remotos. Sin embargo, estos robots no son de propósito general; cada tarea se entrena específicamente mediante teleoperación, ejemplos de video y simulación. El enfoque de Google involucra tres modelos distintos: Gemini Robotics 2, un modelo VLA que convierte entradas visuales y de lenguaje en control motor para el control de todo el cuerpo; Gemini Robotics ER 2, un VLM de razonamiento encarnado que actúa como agente cerebral para la comunicación, planificación de tareas de múltiples pasos y habilitación de la colaboración en equipo de robots; y Gemini Robotics On-Device 2, un modelo VLA para ejecución local con rápida adaptación a nuevos cuerpos de robot, heredado de Gemini Robotics 1.5. Para la seguridad, Google introdujo ASIMOV-Agentic, un punto de referencia para la orquestación de seguridad agéntica y resolución de incertidumbre, que mide la capacidad del agente para rechazar llamadas de herramientas inseguras y predecir la finalización de tareas. Gemini Robotics ER 2 es el modelo de robot más seguro hasta la fecha, detectando la proximidad humana y deteniendo a los robots en consecuencia. El software se ejecuta en cuerpos de robot, muchos de los cuales se fabrican en China, a pesar de las recientes restricciones estadounidenses sobre robots de fabricación china.
Fuente: InfoQ 中国 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas