الروبوتاتالنماذج 🇨🇳 12.08.2026 06:01

سباق أدمغة الروبوتات يدخل المياه العميقة: لماذا يتطلب العالم المادي تصميم نماذج من الصفر

في مؤتمر الذكاء الاصطناعي العالمي 2025، احتل الذكاء الاصطناعي التجسيدي مركز الصدارة بمشاركة أكثر من 200 شركة، مع تحول التركيز من الروبوتات الاستعراضية إلى التطبيقات العملية مثل المناولة والتفتيش. يرى شين يوجون، كبير العلماء في شركة Ant Lingbo، أن تكييف نماذج الفيديو من العالم الرقمي لتلائم الروبوتات عبر الضبط الدقيق هو اختصار يعتمد على المسار، وليس حلاً نهائياً، داعياً إلى نهج “تجسيدي أصيل” مع تصميم نماذج من الأساس للواقع المادي. كشفت الشركة عن نموذج Brain 2.0 المتكامل الذي يضم ستة نماذج، بما في ذلك أول نموذج للعمل في العالم التجسيدي أصيل في الصناعة، وأعلنت عن جولة تمويل تهدف إلى جمع 1.5 مليار يوان.
في مقابلة على هامش مؤتمر WAIC (مؤتمر شنغهاي العالمي للذكاء الاصطناعي)، تحدّث شن يوجون، كبير علماء Ant Lingbo، عن تحديات الذكاء المتجسّد (Embodied Intelligence)، مؤكدًا أن معايير البيانات لم تتوحّد بعد لأن المسار التقني لم يُحسم حتى الآن، فلا يوجد توافق بشأن الأنماط (modalities) أو الدقة أو الجودة. وأشار إلى أن البيانات الحقيقية، وبخاصة بيانات التشغيل عن بُعد (teleoperation) المستمدة من الروبوتات والبيانات المأخوذة من منظور الإنسان في الشخص الأول، أكثر أهمية من بيانات المحاكاة بالنسبة للروبوتات ذات الاستخدام العام، لأن المحاكاة تعجز عن تكرار الأفعال اللاوعية التي يقوم بها البشر بشكل تلقائي. وتتمثل استراتيجية Lingbo في تطوير عدة نماذج (مثل LingBot-Vision وLingBot-Depth وLingBot-Video وLingBot-VLA وLingBot-VA) لحل مشكلات تقنية محددة، مثل مواءمة الأنماط المختلفة، والتنبؤ بالديناميكيات، وضمان توازن الحمل في بنى مزيج الخبراء (MoE - Mixture of Experts)، بدلًا من محاولة بناء نموذج واحد شامل من طرف إلى طرف (end-to-end) في وقت مبكر جدًا. وقدّم شن مفهوم النماذج "الأصيلة التجسّد" (embodied-native)، والتي تتطلب بيانات أصيلة نابعة من مهام العالم الفيزيائي، وقدرات نموذجية مناسبة للتفاعل في الزمن الحقيقي، والقدرة على التدريب من الصفر، مشيرًا إلى الصعوبات القائمة في تكرار نماذج الرؤية ذاتية الإشراف (self-supervised) مثل DINO، وفي تطبيق النمذجة السببية (causal modeling) القائمة على الانتباه أحادي الاتجاه (one-way attention). وفيما يتعلق بالسلامة، أكد أن السلامة "القائمة على الحواجز" (fence-based)، التي تقيّد الأفعال، غير كافية، ودعا إلى ما أسماه "السلامة الأصيلة" (native safety) التي تُغرس في النموذج أثناء مرحلة التدريب المسبق (pretraining)، على غرار الغرائز البشرية. كما تنبأ بأن "لحظة ChatGPT" الخاصة بالذكاء الاصطناعي المتجسّد ستحدث عندما يصبح بإمكان الناس العاديين المشاركة بسهولة في جمع البيانات، وهو ما سيجعل الروبوتات مفيدة بحق ومندمجة في الحياة اليومية.
المصدر: InfoQ 中国 — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة