BeingBeyond、「Being-H0.8」を発表——50万時間のビデオで学習した初の暗黙的触覚世界行動モデル
中国のAI企業BeingBeyond(智在無界)は、人間のビデオデータに基づく初の暗黙的触覚世界行動モデル「Being-H0.8」をリリースしました。50万時間以上の一人称視点ビデオで学習したこのモデルは、触覚フィードバックを予測・実行・調整のループに統合し、ロボットが接触を予測し、リアルタイムで行動を調整することを可能にします。このシステムは、バッグから物体を取り出す、筆で書く、歯磨き粉を絞り出す、ロボットアームでチップをつまむといった高精度なタスクを成功させました。
BeingBeyondは、人間のビデオデータから構築された初の暗黙的触覚世界行動モデル「Being-H0.8」を発表した。このモデルは触覚モダリティを潜在空間表現に組み込み、従来のBeing-H0.7視覚世界モデルを拡張している。インタラクション結果を予測するためにMixture of Transformers(MoT)を使用し、実行とリアルタイム調整にはスローファストアクションエキスパート(Slow-Fast Action Expert)、触覚信号を統一するためにユニバーサル触覚エンコーダ(Universal Tactile Encoder)、人間とロボットの行動空間を整合させるTopoHandを採用している。トレーニングデータプールは50万時間超の一人称視点ビデオから構成され、クリーニング・処理されてUniHand-3.0データセットとなった。ビデオ内の触覚ラベル不足に対処するため、BeingBeyondはTactoHandを開発し、視覚データから接触と近接性を推論し、実際の圧力グローブデータで補完している。モデルは、バッグからの物体取り出し、筆での文字書き、歯磨き粉の絞り出し、チップス拾いなどのタスクを実行する二腕ロボットでテストされ、触覚フィードバックを必要とする繊細な操作を処理する能力を実証した。BeingBeyondは2025年5月に北京大学准教授のLu Zongqingによって設立され、人間のビデオトレーニングの実現可能性の証明(Being-H0からH0.5)、スケールアップ(H0.5からH0.7)、そして現在のデータ品質向上(H0.8)の3段階を経て進化してきた。
出典: QbitAI 量子位 —
原文
