Kandinsky WM 1.0: Generatieve modellen voor fysieke AI
Сбер
NVIDIA
Meta
Sber heeft Kandinsky WM 1.0 uitgebracht, een set van drie beeld-naar-video-modellen die zijn ontworpen voor autonome voertuigen, robotica en complexe natuurkundige scènes. De modellen, die gebaseerd zijn op Kandinsky 5.0 Video Lite, zijn beschikbaar onder de MIT-licentie en zijn bedoeld om de schaarste aan gegevens in fysieke AI aan te pakken door natuurkundig nauwkeurige synthetische video's te genereren.
Sber heeft Kandinsky WM 1.0 open-sourced, een set van drie gespecialiseerde videogeneratiemodellen voor Physical AI: K5-AV voor autonome voertuigen, K5-RO voor robotica en K5-PH voor scènes met complexe fysica. De modellen zijn gebaseerd op de Kandinsky 5.0 Video Lite met 2 miljard parameters en werken in image-to-video-modus, waarbij ze een eerste frame en een tekstprompt gebruiken om een vervolg te genereren. Elk model is domeinspecifiek aangepast op specifieke datasets: 1,5 miljoen video's van NVIDIA PhysicalAI Autonomous Vehicles, 2,2 miljoen robotica-video's uit verschillende bronnen, waaronder GenRobot 10Kh RealOmni en AgiBot World Beta, en 1,6 miljoen fysica-video's, waarvan 1,3 miljoen uit pre-training en 300.000 handmatig gecureerd. Na de domeinaanpassing ondergingen de modellen een tweede trainingsfase: RL met een beloningsmodel voor K5-AV en K5-RO, en SOAR voor K5-PH. De release omvat code en gewichten onder de MIT-licentie. Het artikel benadrukt ook het long-tail dataprobleem in Physical AI, waarbij zeldzame scenario's cruciaal zijn maar moeilijk te verzamelen, en merkt op dat huidige videogeneratiemodellen vaak fysieke betrouwbaarheid ontberen, wat domeinspecifieke training en post-training noodzakelijk maakt.
Bron: Habr — хаб ML —
origineel
