3만 시간의 촉각 데이터, 체현 AI에 촉각 부여
NeoteAI와 푸단대학교(复旦大学)가 N0 시리즈 아래 세 가지 보고서와 모델을 발표하여 촉각 피드백을 체현 AI(embodied AI)의 핵심 구성 요소로 통합하는 것을 목표로 합니다. 프로젝트에는 3만 시간의 촉각 상호작용 데이터셋, 비전-언어-행동 모델 N0-VTLA, 그리고 세계 모델 N0-TWAM이 포함되며, 모두 오픈소스로 제공됩니다.
NeoteAI(上海诺谛智能体科技有限公司)与复旦大学可信具身智能研究院合作,发布了N0系列模型的三份技术报告。Neodata数据集包含超过30000小时的视觉-触觉交互数据、140万个动作片段、330亿个时间步、80亿个RGB帧以及100亿个触觉图像,这些数据来自6个机器人平台(Franka、Piper、UR5e等),由90名操作员覆盖450个长周期任务采集完成。N0-VTLA是一款触觉增强的视觉-语言-动作模型,能够预测未来50步的触觉状态,在插头插入任务中成功率达85%(纯视觉模型为60%),钥匙提取任务中成功率达99%(纯视觉模型为35%)。N0-TWAM是一个拥有72亿参数的世界模型,采用混合专家架构,可同时预测视频、触觉和动作序列;仿真环境平均成功率为84.5%(基线为36%),真实世界平均成功率为46.3%(LingBot-VA为21.9%)。该项目已在research.neoteai.com开源。
출처: QbitAI 量子位 —
원문
