Kandinsky WM 1.0 : modèles génératifs pour l'IA physique
Сбер
NVIDIA
Meta
Sber a publié Kandinsky WM 1.0, un ensemble de trois modèles image-vers-vidéo conçus pour les véhicules autonomes, la robotique et les scènes physiques complexes. Basés sur Kandinsky 5.0 Video Lite, ces modèles sont disponibles sous licence MIT et visent à pallier la rareté des données en IA physique en générant des vidéos synthétiques physiquement précises.
Sber a ouvert le code de Kandinsky WM 1.0, un ensemble de trois modèles spécialisés de génération vidéo pour l'IA physique : K5-AV pour les véhicules autonomes, K5-RO pour la robotique et K5-PH pour les scènes à physique complexe. Les modèles sont basés sur Kandinsky 5.0 Video Lite, qui compte 2 milliards de paramètres, et fonctionnent en mode image-vers-vidéo, prenant une première image et une invite textuelle pour générer une suite. Chaque modèle a été adapté au domaine sur des ensembles de données spécifiques : 1,5 million de vidéos issues de NVIDIA PhysicalAI Autonomous Vehicles, 2,2 millions de vidéos robotiques provenant de diverses sources, notamment GenRobot 10Kh, RealOmni et AgiBot World Beta, et 1,6 million de vidéos physiques, dont 1,3 million issues du pré-entraînement et 300 000 sélectionnées manuellement. Après l'adaptation au domaine, les modèles ont subi une deuxième étape d'entraînement : l'apprentissage par renforcement avec un modèle de récompense pour K5-AV et K5-RO, et SOAR pour K5-PH. La version publiée comprend le code et les poids sous licence MIT. L'article souligne également le problème des données à longue traîne dans l'IA physique, où les scénarios rares sont critiques mais difficiles à collecter, et note que les modèles de génération vidéo actuels manquent souvent de fidélité physique, ce qui nécessite un entraînement spécifique au domaine et un post-entraînement.
Source: Habr — хаб ML —
original
