30.000 Stunden Tastdaten verleihen verkörperter KI einen Tastsinn
NeoteAI und die Fudan University haben eine Reihe von drei Berichten und Modellen unter der N0-Serie veröffentlicht, die darauf abzielen, haptisches Feedback als Kernkomponente verkörperter KI zu integrieren. Das Projekt umfasst einen 30.000-stündigen Datensatz taktiler Interaktionen, ein Sprach-Bild-Aktionsmodell N0-VTLA und ein Weltmodell N0-TWAM, die alle quelloffen sind.
NeoteAI (Shanghai New Intelligent Embodied AI Technology Co., Ltd.) hat in Zusammenarbeit mit dem Trustworthy Embodied AI Research Institute der Fudan University drei technische Berichte für die N0-Modellserie veröffentlicht. Der Neodata-Datensatz enthält über 30.000 Stunden visuell-taktile Interaktionsdaten, 1,4 Millionen Aktionssegmente, 33 Milliarden Zeitschritte, 8 Milliarden RGB-Bilder und 10 Milliarden taktile Bilder, die von 6 Roboterplattformen (Franka, Piper, UR5e usw.) gesammelt wurden und 450 langanhaltende Aufgaben von 90 Bedienern abdecken. N0-VTLA ist ein taktil verbessertes Vision-Language-Action-Modell (VLA), das zukünftige taktile Zustände 50 Schritte im Voraus vorhersagt und eine Erfolgsquote von 85% bei Steckverbindungen erreicht (im Vergleich zu 60% bei rein visueller Erkennung) sowie 99% bei der Schlüsselextraktion (im Vergleich zu 35%). N0-TWAM ist ein Weltmodell mit 7,2 Milliarden Parametern, das eine Mixture-of-Experts-Architektur verwendet und gleichzeitig Video-, Tast- und Aktionssequenzen vorhersagt; die durchschnittliche Erfolgsquote in Simulationen beträgt 84,5% (Basislinie 36%), in der realen Welt durchschnittlich 46,3% (LingBot-VA 21,9%). Das Projekt ist unter research.neoteai.com als Open Source verfügbar.
Quelle: QbitAI 量子位 —
Original
