ModelosCódigo Aberto 🇷🇺 04.08.2026 11:03

Kandinsky WM 1.0: Modelos Generativos para IA Física

СберСбер NVIDIANVIDIA MetaMeta
A Sber lançou o Kandinsky WM 1.0, um conjunto de três modelos de imagem para vídeo, projetados para veículos autônomos, robótica e cenas físicas complexas. Os modelos, baseados no Kandinsky 5.0 Video Lite, estão disponíveis sob a licença MIT e visam abordar a escassez de dados na IA Física, gerando vídeos sintéticos fisicamente precisos.
A Sber disponibilizou em código aberto o Kandinsky WM 1.0, um conjunto de três modelos especializados de geração de vídeo para IA Física: K5-AV para veículos autônomos, K5-RO para robótica e K5-PH para cenas com física complexa. Os modelos são baseados no Kandinsky 5.0 Video Lite, com 2 bilhões de parâmetros, e operam no modo imagem-para-vídeo, recebendo um primeiro quadro e um prompt de texto para gerar uma continuação. Cada modelo foi adaptado por domínio em conjuntos de dados específicos: 1,5 milhão de vídeos do NVIDIA PhysicalAI Autonomous Vehicles, 2,2 milhões de vídeos de robótica de várias fontes, incluindo GenRobot 10Kh RealOmni e AgiBot World Beta, e 1,6 milhão de vídeos de física, com 1,3 milhão provenientes de pré-treinamento e 300 mil curados manualmente. Após a adaptação de domínio, os modelos passaram por um segundo estágio de treinamento: aprendizagem por reforço com um modelo de recompensa para K5-AV e K5-RO, e SOAR para K5-PH. O lançamento inclui código e pesos sob a licença MIT. O artigo também destaca o problema de dados de cauda longa na IA Física, onde cenários raros são críticos, mas difíceis de coletar, e observa que os modelos atuais de geração de vídeo frequentemente carecem de fidelidade física, exigindo treinamento específico por domínio e pós-treinamento.
Fonte: Habr — хаб ML — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas