Gemini Robotics 2 bringt Ganzkörperintelligenz zu Robotern
Google/DeepMind
DeepMind
Google DeepMind stellt Gemini Robotics 2 vor, eine Suite von KI-Modellen, die Ganzkörpersteuerung, Geschicklichkeit und Multi-Roboter-Kollaboration für anpassungsfähige Roboter ermöglicht. Die Modelle umfassen ein Visuell-Sprach-Aktionsmodell (VLA, Vision-Language Action), ein Verkörpertes Argumentationsmodell (ER, Embodied Reasoning) und ein On-Device-VLA und unterstützen Aufgaben vom humanoiden Gehen bis zur feinen Manipulation.
Google DeepMind hat Gemini Robotics 2 angekündigt, eine neue Intelligenzschicht für Roboter, die Ganzkörpersteuerung, feine Geschicklichkeit und Multi-Roboter-Kollaboration ermöglicht. Das System umfasst drei Modelle: Gemini Robotics 2, ein Vision-Language-Action-Modell (VLA) für die Motorsteuerung; Gemini Robotics ER 2, ein verkörpertes Reasoning-Modell für Planung und Kommunikation; und Gemini Robotics On-Device 2, ein effizientes VLA, das für die lokale Ausführung optimiert ist. Diese Modelle können humanoiden Roboter wie den Apptronik Apollo 2 von den Füßen bis zu den Fingerspitzen steuern, heikle Aufgaben wie das Binden von Knoten mit einer Hand mit fünf Fingern ausführen und Multi-Roboter-Teamarbeit ermöglichen. Das ER-Modell ist in Google AI Studio und in einer privaten Vorschau auf der Gemini Enterprise Agent Platform verfügbar, während die VLA- und On-Device-Modelle für Early-Access-Partner bestimmt sind. Zu den Sicherheitsmaßnahmen gehören der ASIMOV-Agentic-Benchmark für sichere Tool-Aufrufe und die Erkennung von Menschen in der Nähe. Diese Arbeit markiert einen Meilenstein auf dem Weg zu einer allgemeinen physischen künstlichen Intelligenz.
Quelle: Google DeepMind —
Original
