智在无界发布Being-H0.8:首个隐式触觉世界-动作模型,在50万小时视频上训练
中国AI公司智在无界(BeingBeyond)发布了Being-H0.8,这是首个基于人类视频数据的隐式触觉世界-动作模型。该模型在超过50万小时的第一人称视频上训练,将触觉反馈融入预测-执行-调整循环,使机器人能够预判接触并实时调整动作。该系统成功完成了高精度任务,如从包中取物、用毛笔写字、挤牙膏以及用机械臂取薯片。
BeingBeyond发布了Being-H0.8,这是首个基于人类视频数据构建的隐式触觉世界-动作模型。该模型将触觉模态融入潜在空间表征,扩展了此前的视觉世界模型Being-H0.7。它采用混合专家变换器(Mixture of Transformers,MoT)预测交互结果,配备慢-快动作专家(slow-fast action expert)用于执行与实时调整,通用触觉编码器(Universal Tactile Encoder)统一触觉信号,以及TopoHand对齐人类与机器人动作空间。训练数据池超过50万小时的第一人称视频,经清洗处理后形成UniHand-3.0数据集。为解决视频中缺乏触觉标签的问题,BeingBeyond开发了TactoHand,从视觉数据推断接触与接近信息,并通过真实压力手套数据进行补充。该模型在双臂机器人上进行了测试,执行任务包括从包中取物、用毛笔写字、挤牙膏以及捡起薯片,展示了其处理需要触觉反馈的精细操作的能力。BeingBeyond成立于2025年5月,创始人为北京大学副教授卢宗青,目前已走过三个阶段:验证人类视频训练可行性(Being-H0至H0.5)、规模化扩展(H0.5至H0.7)、以及当前提升数据质量(H0.8)。
来源: QbitAI 量子位 —
原文
