RobotiqueModèles 🇨🇳 28.07.2026 10:03

BeingBeyond dévoile Being-H0.8, le premier modèle monde-action tactile implicite entraîné sur 500 000 heures de vidéo

La société chinoise d'IA BeingBeyond (智在无界) a publié Being-H0.8, le premier modèle monde-action tactile implicite basé sur des données vidéo humaines. Entraîné sur plus de 500 000 heures de vidéo à la première personne, le modèle intègre le retour tactile dans la boucle de prédiction-exécution-ajustement, permettant aux robots d'anticiper le contact et d'ajuster leurs actions en temps réel. Le système a réussi des tâches de haute précision comme récupérer des objets dans un sac, écrire avec un pinceau, presser du dentifrice et ramasser des chips avec un bras robotique.
BeingBeyond a dévoilé Being-H0.8, le premier modèle tacite monde-action implicite construit à partir de données vidéo humaines. Le modèle intègre la modalité tactile dans une représentation d'espace latent, élargissant le précédent modèle visuel Being-H0.7. Il utilise un Mixture of Transformers (MoT) pour prédire les résultats d'interaction, un expert d'action rapide-lent pour l'exécution et l'ajustement en temps réel, un Universal Tactile Encoder pour unifier les signaux tactiles, et TopoHand pour aligner les espaces d'action humains et robots. Le pool de données d'entraînement dépasse 500 000 heures de vidéo à la première personne, nettoyées et traitées dans le dataset UniHand-3.0. Pour pallier l'absence d'étiquettes tactiles dans les vidéos, BeingBeyond a développé TactoHand pour inférer le contact et la proximité à partir de données visuelles, complétées par des données réelles de gants de pression. Le modèle a été testé sur des robots à deux bras effectuant des tâches comme récupérer des objets dans un sac, écrire avec un pinceau, presser du dentifrice et ramasser des chips, démontrant sa capacité à gérer des manipulations délicates nécessitant un retour tactile. BeingBeyond a été fondée en mai 2025 par Lu Zongqing, professeur associé à l'Université de Pékin, et a progressé à travers trois étapes : prouver la faisabilité de l'entraînement sur vidéo humaine (Being-H0 à H0.5), passer à l'échelle (H0.5 à H0.7), et maintenant améliorer la qualité des données (H0.8).
Source: QbitAI 量子位 — original
Nos articles précédents sur ce sujet ↓
Infos fraîches