InvestigaciónRobótica 🇨🇳 03.08.2026 14:01

200 tareas, 17 millones de fotogramas: Daxia Robot publica en código abierto el conjunto de datos encarnado de nivel L5 ACE-Data-0, convirtiendo hogares reales en libros de texto del mundo físico para robots

Daxia Robot, junto con NTU S-Lab, ha publicado en código abierto el conjunto de datos de inteligencia física multimodal encarnada de nivel L5 ACE-Data-0, que contiene 17 millones de fotogramas, 200 categorías de tareas, 50 participantes y dos escenarios de hogares reales. El conjunto de datos captura datos multimodales sincronizados, incluyendo vídeo en primera y tercera persona, movimiento del cuerpo completo y de las manos, trayectorias de objetos, audio y señales táctiles, todo alineado a una línea temporal común y a un sistema de coordenadas espacial. ACE-Data-0 tiene como objetivo proporcionar una base de datos de alta calidad para modelos encarnados, apoyando la generalización, la reflexión y la evolución hacia una implementación escalable en el mundo real.
Daxia Robot, en colaboración con el S-Lab de la Universidad Tecnológica de Nanyang, ha liberado el código abierto del conjunto de datos ACE-Data-0, un conjunto de datos de inteligencia física encarnada multimodal de nivel L5. Basado en la primera ley de densidad de información para modelos encarnados y el esquema de recolección de datos ambientales centrado en humanos 2.0, el conjunto de datos utiliza el motor de recolección ambiental ACE. ACE-Data-0 incluye 17 millones de fotogramas de video, 200 categorías de tareas, 50 participantes, 2 escenas domésticas reales y 75,000 segmentos de interacción, que cubren interacciones humano-objeto a nivel atómico, cadenas de actividades domésticas de largo alcance e interacciones humano-entorno. Los datos se capturan sincrónicamente desde video en primera persona, video en tercera persona multivista, movimiento del cuerpo completo y de las manos, trayectorias de objetos con seis grados de libertad, audio multicanal y señales táctiles, todo alineado a una línea de tiempo unificada y un sistema de coordenadas espaciales. El conjunto de datos utiliza dos sistemas de recolección complementarios: un sistema a escala de mesa para interacciones finas mano-objeto y un sistema a escala de sala para actividades en toda la habitación, con calibración y sincronización compartidas. A diferencia de la recolección por guion, ACE-Data-0 utiliza instrucciones a nivel de objetivo, lo que permite a los participantes elegir libremente artículos, secuencias y rutas, preservando variaciones naturales como dudas y reversas. Basado en el conjunto de datos, Daxia ha establecido un punto de referencia de evaluación de tres niveles para la percepción encarnada, probando modelos en detección de contacto, recuperación de estado y comprensión de interacciones mano-objeto. Las evaluaciones de más de 30 métodos representativos muestran brechas de capacidad significativas en contacto, oclusión severa, egomoción, puntos de vista extremos y tareas de largo alcance. El conjunto de datos está diseñado para apoyar el aprendizaje por imitación, modelos de mundo, modelos VLA, aprendizaje de políticas de robots y la transferencia de demostraciones humanas a diferentes morfologías de robots.
Fuente: InfoQ 中国 — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas