ロボット脳競争は深海へ:物理世界にはゼロからモデルを設計する理由
2025年のWAICで、具現化AIが中心となり、200社以上の企業が展示し、焦点はパフォーマンスロボットから、ハンドリングや検査などの実用的なアプリケーションに移りました。Ant LingboのチーフサイエンティストであるShen Yujun氏は、デジタル世界のビデオモデルをファインチューニングでロボットに適応させるのは、経路依存の近道であり、最終的な解決策ではないと主張し、物理的現実のためにゼロから設計されたモデルを用いる「具現化ネイティブ」アプローチを提唱しています。同社は、業界初の具現化ネイティブな世界行動モデルを含む6つのモデルからなるフルスタックのBrain 2.0を発表し、15億元の調達を目指す資金調達ラウンドを発表しました。
WAICでのインタビューで、蚂蚁数科(Ant Lingbo)のチーフサイエンティストである沈宇軍氏は、身体化知能(embodied intelligence)の課題について議論し、技術的経路がまだ決定されていないため、データ標準が収束していないことを強調しました。モダリティ、精度、品質についてのコンセンサスはなく、特にロボットからの遠隔操作データや人間からの一人称データといった実データが、汎用ロボットにとってシミュレーションデータよりも重要であると指摘しました。シミュレーションは人間の無意識の動作を再現するのが難しいからです。Lingboの戦略は、複数のモデル(LingBot-Vision、LingBot-Depth、LingBot-Video、LingBot-VLA、LingBot-VAなど)を開発して、モダリティの整合、ダイナミクスの予測、Mixture of Experts(MoE)アーキテクチャにおける負荷分散といった特定の技術的課題を解決することであり、時期尚早に単一のエンドツーエンドモデルを試みることではありません。沈氏は「身体化ネイティブ(embodied-native)」モデルの概念を紹介しました。これは、物理世界のタスクに固有のデータ、リアルタイムインタラクションに適したモデル能力、およびスクラッチからのトレーニング能力を必要とし、DINOのような自己教師あり視覚モデルの再現や、一方向注意のための因果モデリングの実装の難しさを挙げました。安全性に関しては、「フェンスベース」の安全性(行動を制限する)は不十分であり、人間の本能と同様に、事前学習中に組み込まれる「ネイティブ安全性」を提唱しました。また、身体化AIにとっての「ChatGPTの瞬間」は、一般の人々が容易にデータ収集に参加できるようになり、ロボットが真に有益で日常生活に統合されたときに起こると予測しました。
出典: InfoQ 中国 —
原文
