30 000 heures de données tactiles donnent à l'IA incarnée un sens du toucher
NeoteAI et l'Université de Fudan ont publié une série de trois rapports et modèles sous la série N0, visant à intégrer le retour tactile comme composant central de l'IA incarnée. Le projet comprend un ensemble de données d'interaction tactile de 30 000 heures, un modèle vision-langage-action N0-VTLA, et un modèle du monde N0-TWAM, tous en open source.
NeoteAI (Shanghai New Intelligent Embodied AI Technology Co., Ltd.), en collaboration avec le Trustworthy Embodied AI Research Institute de l'Université de Fudan, a publié trois rapports techniques pour la série de modèles N0. Le jeu de données Neodata contient plus de 30 000 heures de données d'interaction visuo-tactile, 1,4 million de segments d'action, 33 milliards de pas de temps, 8 milliards d'images RVB et 10 milliards d'images tactiles, collectées à partir de 6 plateformes robotiques (Franka, Piper, UR5e, etc.) couvrant 450 tâches à long horizon par 90 opérateurs. N0-VTLA est une VLA (Vision-Language-Action) améliorée tactile qui prédit les états tactiles futurs 50 pas à l'avance, atteignant un taux de succès de 85% pour l'insertion de prise (contre 60% pour la vision seule) et de 99% pour l'extraction de clé (contre 35%). N0-TWAM est un modèle du monde avec 7,2 milliards de paramètres utilisant une architecture à mélange d'experts, qui prédit simultanément des séquences vidéo, tactiles et d'action ; le taux de succès moyen en simulation est de 84,5% (ligne de base 36%), en monde réel de 46,3% (LingBot-VA 21,9%). Le projet est open source sur research.neoteai.com.
Source: QbitAI 量子位 —
original
