La course au cerveau des robots entre en eaux profondes : pourquoi le monde physique exige de concevoir des modèles à partir de zéro
À la WAIC 2025, l'IA incarnée était à l'honneur avec plus de 200 entreprises exposantes, déplaçant l'attention des robots de performance vers des applications pratiques comme la manipulation et l'inspection. Shen Yujun, scientifique en chef d'Ant Lingbo, affirme qu'adapter les modèles vidéo du monde numérique aux robots via un réglage fin est un raccourci dépendant du chemin, et non une solution ultime, plaidant pour une approche « incarnée-nativement » avec des modèles conçus dès le départ pour la réalité physique. L'entreprise a dévoilé sa pile complète Brain 2.0 avec six modèles, dont le premier modèle d'action-monde incarné-nativement de l'industrie, et a annoncé un cycle de financement visant à lever 1,5 milliard de yuans.
Dans une interview au WAIC, le scientifique en chef d'Ant Lingbo, Shen Yujun, a discuté des défis de l'intelligence incarnée, soulignant que les normes de données ne convergent pas car les voies techniques ne sont pas encore décidées, sans consensus sur les modalités, la précision ou la qualité. Il a noté que les données réelles, en particulier les données de téléopération provenant de robots et les données à la première personne provenant d'humains, sont plus critiques que les données de simulation pour les robots généralistes, car les simulations peinent à reproduire les actions subconscientes humaines. La stratégie de Lingbo consiste à développer plusieurs modèles (comme LingBot-Vision, LingBot-Depth, LingBot-Video, LingBot-VLA et LingBot-VA) pour résoudre des problèmes techniques spécifiques, tels que l'alignement des modalités, la prédiction de la dynamique et la garantie de l'équilibrage de charge dans les architectures MoE, plutôt que de tenter un modèle unique de bout en bout prématurément. Shen a introduit le concept de modèles « natifs incarnés », nécessitant des données natives aux tâches du monde physique, des capacités de modélisation adaptées à l'interaction en temps réel et la capacité d'entraîner à partir de zéro, citant les difficultés à répliquer des modèles de vision auto-supervisés comme DINO et à implémenter la modélisation causale pour l'attention unidirectionnelle. Sur la sécurité, il a insisté sur le fait que la sécurité « basée sur des barrières » (restreindre les actions) est insuffisante, plaidant pour une « sécurité native » intégrée lors du pré-entraînement, similaire aux instincts humains. Il a également prédit que le « moment ChatGPT » pour l'IA incarnée se produira lorsque les gens ordinaires pourront facilement participer à la collecte de données, rendant les robots réellement bénéfiques et intégrés dans la vie quotidienne.
Source: InfoQ 中国 —
original
