RobotikModelle 🇨🇳 28.07.2026 10:03

BeingBeyond stellt Being-H0.8 vor: das erste implizite taktile Welt-Aktionsmodell, trainiert auf 500.000 Stunden Video

Das chinesische KI-Unternehmen BeingBeyond (智在无界) hat Being-H0.8 veröffentlicht, das erste implizite taktile Welt-Aktionsmodell, das auf menschlichen Videodaten basiert. Trainiert auf über 500.000 Stunden Videomaterial aus der Ich-Perspektive, integriert das Modell taktiles Feedback in die Vorhersage-Ausführungs-Anpassungs-Schleife, sodass Roboter Kontakt antizipieren und Aktionen in Echtzeit anpassen können. Das System führte erfolgreich hochpräzise Aufgaben aus, wie das Herausholen von Gegenständen aus einer Tasche, das Schreiben mit einem Pinsel, das Ausdrücken von Zahnpasta und das Aufheben von Chips mit einem Roboterarm.
BeingBeyond hat Being-H0.8 vorgestellt, das erste implizite taktile Welt-Aktions-Modell, das aus menschlichen Videodaten erstellt wurde. Das Modell integriert die taktile Modalität in eine Darstellung im latenten Raum und erweitert das bisherige visuelle Weltmodell Being-H0.7. Es verwendet eine Mischung von Transformatoren (Mixture of Transformers, MoT), um Interaktionsergebnisse vorherzusagen, einen Slow-Fast-Aktions-Experten zur Ausführung und Echtzeitanpassung, einen universellen taktilen Encoder (Universal Tactile Encoder), um taktile Signale zu vereinheitlichen, und TopoHand, um die Aktionsräume von Menschen und Robotern abzugleichen. Der Trainingsdatenpool umfasst über 500.000 Stunden First-Person-Videos, die bereinigt und zum Datensatz UniHand-3.0 verarbeitet wurden. Um das Fehlen taktiler Beschriftungen in Videos zu beheben, entwickelte BeingBeyond TactoHand, das Kontakt und Nähe aus visuellen Daten ableitet, ergänzt durch reale Druckhandschuhdaten. Das Modell wurde an Zweiarm-Robotern getestet, die Aufgaben wie das Herausholen von Gegenständen aus einer Tüte, das Schreiben mit einem Pinsel, das Ausdrücken von Zahnpasta und das Aufnehmen von Chips durchführten, und demonstrierte damit seine Fähigkeit, heikle Manipulationen zu bewältigen, die taktile Rückmeldung erfordern. BeingBeyond wurde im Mai 2025 von Lu Zongqing, einem assoziierten Professor an der Peking-Universität, gegründet und hat drei Phasen durchlaufen: Nachweis der Machbarkeit des Trainings mit menschlichen Videos (Being-H0 bis H0.5), Hochskalierung (H0.5 bis H0.7) und nun Verbesserung der Datenqualität (H0.8).
Quelle: QbitAI 量子位 — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten