Kandinsky WM 1.0: Fiziksel Yapay Zeka için Üretken Modeller
Сбер
NVIDIA
Meta
Sber, otonom araçlar, robotik ve karmaşık fizik sahneleri için tasarlanmış üç adet görüntüden videoya model içeren Kandinsky WM 1.0'ı yayınladı. Kandinsky 5.0 Video Lite tabanlı olan modeller, MIT lisansı altında sunuluyor ve Fiziksel Yapay Zeka'daki veri kıtlığını, fiziksel olarak doğru sentetik videolar üreterek gidermeyi amaçlıyor.
Sber, Fiziksel Yapay Zeka için üç özel video üretim modelinden oluşan bir set olan Kandinsky WM 1.0'ı açık kaynak olarak yayınladı: otonom araçlar için K5-AV, robotik için K5-RO ve karmaşık fizik içeren sahneler için K5-PH. Modeller, 2 milyar parametreli Kandinsky 5.0 Video Lite'a dayanıyor ve görüntüden videoya modunda çalışıyor; ilk kareyi ve bir metin istemini alarak devamını üretiyor. Her model belirli veri setleri üzerinde alan adaptasyonuna tabi tutuldu: NVIDIA PhysicalAI Autonomous Vehicles'ten 1,5 milyon video, GenRobot 10Kh RealOmni ve AgiBot World Beta dahil çeşitli kaynaklardan 2,2 milyon robotik videosu ve 1,3 milyonu ön eğitimden, 300 bini manuel olarak küratörlüğü yapılmış 1,6 milyon fizik videosu. Alan adaptasyonunun ardından modeller ikinci bir eğitim aşamasından geçti: K5-AV ve K5-RO için bir ödül modeliyle takviyeli öğrenme ve K5-PH için SOAR. Sürüm, MIT lisansı altında kod ve ağırlıkları içeriyor. Makale ayrıca, nadir senaryoların kritik ancak toplanması zor olduğu Fiziksel Yapay Zekadaki uzun kuyruk veri sorununu vurguluyor ve mevcut video üretim modellerinin genellikle fiziksel doğruluktan yoksun olduğunu, bu nedenle alana özgü eğitim ve eğitim sonrası gerektirdiğini belirtiyor.
Kaynak: Habr — хаб ML —
orijinal
