BeingBeyond تكشف عن Being-H0.8، أول نموذج ضمني لمسي للعالم-فعل مدرب على 500,000 ساعة من الفيديو
أعلنت شركة الذكاء الاصطناعي الصينية BeingBeyond (智在无界) عن إطلاق Being-H0.8، أول نموذج ضمني لمسي للعالم-فعل يعتمد على بيانات فيديو بشرية. تم تدريب النموذج على أكثر من 500,000 ساعة من فيديوهات منظور الشخص الأول، ويدمج التغذية الراجعة اللمسية في حلقة التنبؤ-التنفيذ-التعديل، مما يتيح للروبوتات توقع التلامس وتعديل الإجراءات في الوقت الفعلي. نجح النظام في أداء مهام عالية الدقة مثل استرجاع الأشياء من الحقيبة، والكتابة بالفرشاة، وعصر معجون الأسنان، والتقاط رقائق البطاطس بذراع آلية.
أعلنت شركة BeingBeyond عن إطلاق Being-H0.8، أول نموذج ضمني للعمل العالمي اللمسي مبني على بيانات فيديو بشرية. يدمج النموذج الوضعية اللمسية في تمثيل الفضاء الكامن، موسعًا بذلك نموذج Being-H0.7 البصري العالمي السابق. يستخدم النموذج خليطًا من المحولات (Mixture of Transformers) للتنبؤ بنتائج التفاعل، وخبيرًا في الحركة البطيئة والسريعة للتنفيذ والتعديل في الوقت الحقيقي، ومشفرًا لمسيًا عالميًا (Universal Tactile Encoder) لتوحيد الإشارات اللمسية، ونظام TopoHand لمحاذاة فضاءات الحركة بين الإنسان والروبوت. تتجاوز مجموعة بيانات التدريب 500,000 ساعة من الفيديو من منظور الشخص الأول، تم تنظيفها ومعالجتها في مجموعة بيانات UniHand-3.0. ولمعالجة نقص التصنيفات اللمسية في الفيديو، طورت BeingBeyond نظام TactoHand لاستنتاج التلامس والقرب من البيانات البصرية، معززة ببيانات حقيقية من قفازات الضغط. تم اختبار النموذج على أذرع آلية مزدوجة لأداء مهام مثل استرجاع الأشياء من حقيبة، والكتابة بفرشاة، وعصر معجون الأسنان، والتقاط رقائق البطاطس، مما أظهر قدرته على التعامل مع المناورات الدقيقة التي تتطلب تغذية راجعة لمسية. تأسست BeingBeyond في مايو 2025 بواسطة لو زونغتشينغ، أستاذ مساعد في جامعة بكين، وقد تقدمت عبر ثلاث مراحل: إثبات جدوى التدريب بالفيديو البشري (من Being-H0 إلى H0.5)، والتوسع (من H0.5 إلى H0.7)، والآن تحسين جودة البيانات (H0.8).
المصدر: QbitAI 量子位 —
الأصلي
