200 مهمة و17 مليون إطار: شركة Daxia Robot تفتح مصدر بياناتها متعددة الوسائط ACE-Data-0 بمستوى L5، محولة المنازل الحقيقية إلى كتب دراسية للعالم المادي للروبوتات
قامت شركة Daxia Robot، بالتعاون مع مختبر NTU S-Lab، بفتح مصدر مجموعة بيانات الذكاء الفيزيائي متعدد الوسائط ACE-Data-0 بمستوى L5، والتي تحتوي على 17 مليون إطار، و200 فئة مهام، و50 مشاركًا، ومشهدين منزليين حقيقيين. تلتقط هذه المجموعة بيانات متعددة الوسائط متزامنة بما في ذلك فيديو بمنظور الشخص الأول والثالث، وحركة الجسم الكامل واليدين، ومسارات الأجسام، والصوت، والإشارات اللمسية، وكلها مواءمة على خط زمني مشترك ونظام إحداثيات مكاني. تهدف ACE-Data-0 إلى توفير أساس بيانات عالي الجودة للنماذج المجسدة، ودعم التعميم والتأمل والتطور نحو نشر قابل للتوسع في العالم الحقيقي.
أعلنت شركة Daxia Robot، بالتعاون مع مختبر S-Lab التابع لجامعة نانيانغ التكنولوجية (Nanyang Technological University)، عن فتح المصدر لمجموعة بيانات ACE-Data-0، وهي مجموعة بيانات متعددة الوسائط للذكاء الفيزيائي المتجسّد من المستوى L5. وقد بُنيت هذه المجموعة على أول قانون في العالم لكثافة المعلومات في النماذج المتجسّدة، بالإضافة إلى مخطط جمع بيانات بيئية يتمحور حول الإنسان بالإصدار 2.0، وتستفيد من محرك الجمع البيئي ACE.
تضم مجموعة ACE-Data-0 سبعة عشر مليون إطار فيديو، و200 فئة من المهام، و50 مشاركاً، ومشهدين منزليين حقيقيين، و75,000 مقطع تفاعلي، وتغطي تفاعلات الإنسان مع الأشياء على المستوى الذري، وسلاسل الأنشطة المنزلية الطويلة المدى، وتفاعلات الإنسان مع المشهد المحيط. ويتم جمع البيانات بشكل متزامن من فيديو بمنظور الشخص الأول، وفيديو متعدد الزوايا بمنظور الغائب، وحركة الجسم الكامل واليدين، ومسارات الأجسام بست درجات من الحرية، وصوت متعدد القنوات، وإشارات لمسية، وجميعها متزامنة على إطار زمني ونظام إحداثي مكاني موحّد.
تعتمد مجموعة البيانات على نظامين متكاملين للجمع: نظام على مستوى سطح الطاولة لالتقاط التفاعلات الدقيقة بين اليد والأجسام، ونظام على مستوى الغرفة لتسجيل الأنشطة في الغرفة كاملةً، مع ضبط ومزامنة مشتركين بين النظامين. وخلافاً لأساليب الجمع المكتوبة مسبقاً بسيناريو محدد، تعتمد ACE-Data-0 على تعليمات على مستوى الهدف، مما يسمح للمشاركين بحرية اختيار الأشياء والتسلسلات والمسارات، وبذلك يُحافَظ على التغيرات الطبيعية مثل التردد والتراجع في الحركة.
واستناداً إلى هذه المجموعة، أنشأت Daxia معياراً تقييمياً ثلاثي المستويات للإدراك المتجسّد، يختبر النماذج في استشعار التلامس، واستعادة الحالة، وفهم التفاعل بين اليد والأجسام. وأظهرت تقييمات أُجريت على أكثر من 30 طريقة تمثيلية وجود ثغرات كبيرة في القدرات عند التعامل مع التلامس، والانسداد الشديد للرؤية، والحركة الذاتية، وزوايا النظر المتطرفة، والمهام طويلة المدى.
صُمِّمت مجموعة البيانات هذه لدعم التعلّم بالتقليد، والنماذج العالمية (world models)، ونماذج الرؤية-اللغة-الفعل (Vision-Language-Action - VLA)، وتعلّم سياسات الروبوتات، وكذلك نقل المهارات من العروض التوضيحية البشرية إلى أشكال مختلفة من الروبوتات.
المصدر: InfoQ 中国 —
الأصلي
