Kandinsky WM 1.0: modelos generativos para IA física
Сбер
NVIDIA
Meta
Sber ha lanzado Kandinsky WM 1.0, un conjunto de tres modelos de imagen a video diseñados para vehículos autónomos, robótica y escenas físicas complejas. Los modelos, basados en Kandinsky 5.0 Video Lite, están disponibles bajo la licencia MIT y buscan abordar la escasez de datos en la IA física mediante la generación de videos sintéticos físicamente precisos.
Sber ha liberado el código abierto de Kandinsky WM 1.0, un conjunto de tres modelos especializados de generación de video para IA Física: K5-AV para vehículos autónomos, K5-RO para robótica y K5-PH para escenas con física compleja. Los modelos se basan en Kandinsky 5.0 Video Lite, de 2 mil millones de parámetros, y funcionan en modo de imagen a video, tomando un primer fotograma y una indicación de texto para generar una continuación. Cada modelo fue adaptado a su dominio con conjuntos de datos específicos: 1,5 millones de videos de NVIDIA PhysicalAI Autonomous Vehicles, 2,2 millones de videos de robótica de diversas fuentes, incluidos GenRobot 10Kh RealOmni y AgiBot World Beta, y 1,6 millones de videos de física, con 1,3 millones de preentrenamiento y 300.000 seleccionados manualmente. Tras la adaptación al dominio, los modelos pasaron por una segunda etapa de entrenamiento: aprendizaje por refuerzo con un modelo de recompensa para K5-AV y K5-RO, y SOAR para K5-PH. El lanzamiento incluye el código y los pesos bajo la licencia MIT. El artículo también destaca el problema de los datos de cola larga en la IA Física, donde los escenarios poco frecuentes son cruciales pero difíciles de recopilar, y señala que los modelos actuales de generación de video a menudo carecen de fidelidad física, lo que requiere entrenamiento específico del dominio y postentrenamiento.
Fuente: Habr — хаб ML —
original
