BeingBeyond presenta Being-H0.8, el primer modelo implícito de acción táctil del mundo entrenado con 500.000 horas de vídeo
La empresa china de inteligencia artificial BeingBeyond (智在无界) ha lanzado Being-H0.8, el primer modelo implícito de acción táctil del mundo basado en datos de vídeo humano. Entrenado con más de 500.000 horas de vídeo en primera persona, el modelo integra la retroalimentación táctil en el bucle de predicción-ejecución-ajuste, permitiendo a los robots anticipar el contacto y ajustar las acciones en tiempo real. El sistema realizó con éxito tareas de alta precisión como recuperar objetos de una bolsa, escribir con pincel, exprimir pasta de dientes y recoger patatas fritas con un brazo robótico.
BeingBeyond ha presentado Being-H0.8, el primer modelo táctil implícito de acción-mundo construido a partir de datos de vídeo humano. El modelo incorpora la modalidad táctil en una representación de espacio latente, ampliando el anterior modelo visual del mundo Being-H0.7. Utiliza una Mezcla de Transformers (MoT, por sus siglas en inglés) para predecir los resultados de la interacción, un experto en acciones rápido-lento para la ejecución y el ajuste en tiempo real, un Codificador Táctil Universal para unificar las señales táctiles y TopoHand para alinear los espacios de acción humano y robótico. El conjunto de datos de entrenamiento supera las 500.000 horas de vídeo en primera persona, limpiado y procesado para formar el conjunto de datos UniHand-3.0. Para abordar la falta de etiquetas táctiles en el vídeo, BeingBeyond desarrolló TactoHand para inferir el contacto y la proximidad a partir de datos visuales, complementado con datos reales de guantes de presión. El modelo fue probado en robots de dos brazos realizando tareas como recuperar objetos de una bolsa, escribir con un pincel, apretar pasta de dientes y recoger patatas fritas, demostrando su capacidad para manejar manipulaciones delicadas que requieren retroalimentación táctil. BeingBeyond fue fundada en mayo de 2025 por Lu Zongqing, profesor asociado de la Universidad de Pekín, y ha progresado a través de tres etapas: demostración de la viabilidad del entrenamiento con vídeo humano (Being-H0 a H0.5), escalado (H0.5 a H0.7) y ahora mejora de la calidad de los datos (H0.8).
Fuente: QbitAI 量子位 —
original
