BeingBeyond apresenta Being-H0.8, o primeiro modelo implícito de ação-mundo tátil treinado em 500 mil horas de vídeo
A empresa chinesa de inteligência artificial BeingBeyond (智在无界) lançou o Being-H0.8, o primeiro modelo implícito de ação-mundo tátil baseado em dados de vídeo humano. Treinado em mais de 500 mil horas de vídeo em primeira pessoa, o modelo integra feedback tátil no ciclo de previsão-execução-ajuste, permitindo que robôs antecipem contato e ajustem ações em tempo real. O sistema realizou com sucesso tarefas de alta precisão, como recuperar objetos de uma bolsa, escrever com pincel, apertar pasta de dente e pegar batatas fritas com um braço robótico.
A BeingBeyond lançou o Being-H0.8, o primeiro modelo tátil implícito de ação-mundo construído a partir de dados de vídeos humanos. O modelo incorpora a modalidade tátil em uma representação de espaço latente, expandindo o modelo visual de mundo Being-H0.7 anterior. Ele utiliza um Mixture of Transformers (MoT) para prever resultados de interação, um expert de ação rápida e lenta para execução e ajuste em tempo real, um Codificador Tátil Universal para unificar sinais táteis, e o TopoHand para alinhar os espaços de ação humano e robótico. O conjunto de dados de treinamento excede 500 mil horas de vídeo em primeira pessoa, limpo e processado no conjunto de dados UniHand-3.0. Para lidar com a falta de rótulos táteis em vídeos, a BeingBeyond desenvolveu o TactoHand para inferir contato e proximidade a partir de dados visuais, suplementado por dados reais de luvas de pressão. O modelo foi testado em robôs de braço duplo realizando tarefas como recuperar objetos de uma bolsa, escrever com pincel, apertar pasta de dente e pegar batatas fritas, demonstrando sua capacidade de lidar com manipulações delicadas que exigem feedback tátil. A BeingBeyond foi fundada em maio de 2025 por Lu Zongqing, professor associado da Universidade de Pequim, e progrediu por três estágios: comprovando a viabilidade do treinamento com vídeos humanos (Being-H0 a H0.5), escalando (H0.5 a H0.7) e agora melhorando a qualidade dos dados (H0.8).
Fonte: QbitAI 量子位 —
original
