كاندينسكي WM 1.0: نماذج توليدية للذكاء الاصطناعي الفيزيائي
Сбер
NVIDIA
Meta
أصدرت Sber مجموعة كاندينسكي WM 1.0، وهي مجموعة من ثلاثة نماذج لتحويل الصور إلى فيديو مصممة للمركبات ذاتية القيادة والروبوتات والمشاهد الفيزيائية المعقدة. النماذج، المبنية على كاندينسكي 5.0 فيديو لايت، متاحة بموجب رخصة MIT وتهدف إلى معالجة ندرة البيانات في الذكاء الاصطناعي الفيزيائي من خلال توليد مقاطع فيديو اصطناعية دقيقة فيزيائيًا.
أعلنت شركة Sber عن إتاحة نموذج Kandinsky WM 1.0 مفتوح المصدر، وهو عبارة عن مجموعة من ثلاثة نماذج متخصصة لتوليد الفيديو لتطبيقات الذكاء الاصطناعي الفيزيائي: نموذج K5-AV للمركبات ذاتية القيادة، ونموذج K5-RO للروبوتات، ونموذج K5-PH للمشاهد ذات الفيزياء المعقدة. تستند هذه النماذج إلى نموذج Kandinsky 5.0 Video Lite الذي يحتوي على مليارَي معلمة، وتعمل في وضع تحويل الصورة إلى فيديو، حيث تأخذ إطارًا أوليًا ونصًا وصفيًا لتوليد استمرارية للفيديو. تم تكييف كل نموذج على بيانات متخصصة: 1.5 مليون فيديو من مجموعة بيانات NVIDIA PhysicalAI Autonomous Vehicles للمركبات الذاتية القيادة، و2.2 مليون فيديو للروبوتات من مصادر متنوعة بما في ذلك GenRobot 10Kh وRealOmni وAgiBot World Beta، و1.6 مليون فيديو فيزيائي منها 1.3 مليون من مرحلة ما قبل التدريب و300 ألف تم اختيارها يدويًا. بعد مرحلة التكييف على البيانات، خضعت النماذج لمرحلة تدريب ثانية: تعلم التعزيز مع نموذج مكافأة لكل من K5-AV وK5-RO، وخوارزمية SOAR لنموذج K5-PH. يتضمن الإصدار الكود والأوزان تحت رخصة MIT. كما تسلط المقالة الضوء على مشكلة البيانات طويلة الذيل في الذكاء الاصطناعي الفيزيائي، حيث تكون السيناريوهات النادرة حاسمة ولكن يصعب جمعها، وتشير إلى أن نماذج توليد الفيديو الحالية غالبًا ما تفتقر إلى الدقة الفيزيائية، مما يستلزم تدريبًا متخصصًا على المجال وتدريبًا لاحقًا.
المصدر: Habr — хаб ML —
الأصلي
