ModelSumber Terbuka 🇷🇺 04.08.2026 11:03

Kandinsky WM 1.0: Model Generatif untuk AI Fisik

СберСбер NVIDIANVIDIA MetaMeta
Sber telah merilis Kandinsky WM 1.0, serangkaian tiga model gambar-ke-video yang dirancang untuk kendaraan otonom, robotika, dan skenario fisika kompleks. Model-model ini, yang didasarkan pada Kandinsky 5.0 Video Lite, tersedia di bawah lisensi MIT dan bertujuan mengatasi kelangkaan data dalam AI Fisik dengan menghasilkan video sintetis yang akurat secara fisik.
Sber telah membuka sumber kode Kandinsky WM 1.0, sebuah rangkaian tiga model generasi video khusus untuk Physical AI: K5-AV untuk kendaraan otonom, K5-RO untuk robotika, dan K5-PH untuk skenario dengan fisika yang kompleks. Model-model tersebut didasarkan pada Kandinsky 5.0 Video Lite dengan 2 miliar parameter dan beroperasi dalam mode gambar-ke-video, mengambil bingkai pertama dan prompt teks untuk menghasilkan kelanjutan. Setiap model diadaptasi domain pada dataset spesifik: 1,5 juta video dari NVIDIA PhysicalAI Autonomous Vehicles, 2,2 juta video robotika dari berbagai sumber termasuk GenRobot 10Kh RealOmni dan AgiBot World Beta, serta 1,6 juta video fisika dengan 1,3 juta dari pra-pelatihan dan 300 ribu yang dikurasi secara manual. Setelah adaptasi domain, model-model tersebut menjalani tahap pelatihan kedua: RL dengan model reward untuk K5-AV dan K5-RO, serta SOAR untuk K5-PH. Rilis ini mencakup kode dan bobot di bawah lisensi MIT. Artikel ini juga menyoroti masalah data long-tail dalam Physical AI, di mana skenario langka sangat penting tetapi sulit dikumpulkan, dan mencatat bahwa model generasi video saat ini sering kali kurang memiliki fidelitas fisik, sehingga memerlukan pelatihan khusus domain dan pasca-pelatihan.
Sumber: Habr — хаб ML — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru