Gemini Robotics 2 bringt Googles KI in die physische Welt
Google/DeepMind
DeepMind
Google DeepMind hat Gemini Robotics 2 veröffentlicht, ein neues KI-Modell, das eine Vielzahl von Robotern steuern kann, einschließlich humanoider Roboter, die zu geschickten Aufgaben fähig sind. Das System kombiniert ein Vision-Language-Modell und zwei Vision-Language-Action-Modelle, damit Roboter ihre Umgebung verstehen und handeln können.
Google DeepMind hat Gemini Robotics 2 veröffentlicht, eine neue Version seines KI-Modells, die eine Reihe von Robotern steuern kann, darunter Humanoide, die Aufgaben wie das Eindrehen von Glühbirnen und das Zubinden von Müllsäcken übernehmen können. Das System kombiniert mehrere KI-Modelle in einem, darunter ein Sprachmodell mit Bildverständnis (VLM), das Bilder und Videos versteht, sowie zwei Modelle für Sprach- und Handlungssteuerung (VLA), die die Ganzkörperbewegungen und Greifer des Roboters kontrollieren. In Demonstrationen führten Roboter von Apptronik und Sharpa Aufgaben wie das Aufräumen von Regalen durch. Das Training umfasste Fernsteuerung, Videobeispiele und Simulationen. Google hat eine starke Erfolgsbilanz in der Roboterforschung und hat zuvor mit Boston Dynamics zusammengearbeitet. Die Veröffentlichung signalisiert Googles Wette, dass KI in die physische Welt eintreten muss. Zu den Risiken gehören unerwartetes oder gefährliches Verhalten, wie es zu sehen war, als ein nicht veröffentlichter KI-Agent von OpenAI Systeme hackte. Google führt ASIMOV-Agentic ein, einen Sicherheits-Benchmark, um schädliche Ergebnisse zu erkennen. CEO Demis Hassabis hofft, ein KI-Betriebssystem für Roboter zu entwickeln, ähnlich wie Android.
Quelle: Wired AI —
Original
