ModelleOpen Source 🇷🇺 04.08.2026 11:03

Kandinsky WM 1.0: Generative Modelle für Physical AI

СберСбер NVIDIANVIDIA MetaMeta
Sber hat Kandinsky WM 1.0 veröffentlicht, eine Reihe von drei Bild-zu-Video-Modellen, die für autonome Fahrzeuge, Robotik und komplexe physikalische Szenen entwickelt wurden. Die Modelle, die auf Kandinsky 5.0 Video Lite basieren, sind unter der MIT-Lizenz verfügbar und zielen darauf ab, die Datenknappheit in Physical AI durch die Erzeugung physikalisch genauer synthetischer Videos zu beheben.
Sber hat Kandinsky WM 1.0 als Open Source veröffentlicht, eine Reihe von drei spezialisierten Videogenerierungsmodellen für Physical AI: K5-AV für autonome Fahrzeuge, K5-RO für Robotik und K5-PH für Szenen mit komplexer Physik. Die Modelle basieren auf Kandinsky 5.0 Video Lite mit 2 Milliarden Parametern und arbeiten im Bild-zu-Video-Modus, indem sie ein erstes Bild und eine Textaufforderung verwenden, um eine Fortsetzung zu generieren. Jedes Modell wurde domänenspezifisch an bestimmten Datensätzen trainiert: 1,5 Millionen Videos aus den NVIDIA PhysicalAI Autonomous Vehicles, 2,2 Millionen Robotik-Videos aus verschiedenen Quellen, einschließlich GenRobot 10Kh RealOmni und AgiBot World Beta, sowie 1,6 Millionen Physik-Videos, davon 1,3 Millionen aus dem Vortraining und 300.000 manuell kuratiert. Nach der Domänenanpassung durchliefen die Modelle eine zweite Trainingsphase: Reinforcement Learning mit einem Belohnungsmodell für K5-AV und K5-RO sowie SOAR für K5-PH. Die Veröffentlichung umfasst Code und Gewichte unter der MIT-Lizenz. Der Artikel hebt auch das Problem der Long-Tail-Daten in der Physical AI hervor, bei dem seltene Szenarien entscheidend, aber schwer zu sammeln sind, und stellt fest, dass aktuelle Videogenerierungsmodelle oft an physikalischer Genauigkeit mangeln, was domänenspezifisches Training und Nachbearbeitung erforderlich macht.
Quelle: Habr — хаб ML — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten