MallitAvoin lähdekoodi 🇷🇺 04.08.2026 11:03

Kandinsky WM 1.0: Generatiiviset mallit fyysiseen tekoälyyn

СберСбер NVIDIANVIDIA MetaMeta
Sber on julkaissut Kandinsky WM 1.0 -malliston, joka sisältää kolme kuvasta videoksi -mallia, jotka on suunniteltu autonomisiin ajoneuvoihin, robotiikkaan ja monimutkaisiin fysiikan skenaarioihin. Mallit perustuvat Kandinsky 5.0 Video Lite -malliin, ne on julkaistu MIT-lisenssillä ja niiden tavoitteena on ratkaista fyysisen tekoälyn datapula tuottamalla fysikaalisesti tarkkoja synteettisiä videoita.
Sber on julkaissut avoimen lähdekoodin Kandinsky WM 1.0 -mallit, jotka koostuvat kolmesta erikoistuneesta videogenerointimallista Physical AI:ta varten: K5-AV autonomisille ajoneuvoille, K5-RO robotiikalle ja K5-PH monimutkaista fysiikkaa sisältäville kohtauksille. Mallit perustuvat 2 miljardin parametrin Kandinsky 5.0 Video Lite -malliin ja toimivat kuvasta videoksi -tilassa, jossa ne ottavat ensimmäisen kuvan ja tekstikehotteen jatkon tuottamiseksi. Jokainen malli on sovitettu tietyille tietoaineistoille: 1,5 miljoonaa videota NVIDIA PhysicalAI Autonomous Vehicles -aineistosta, 2,2 miljoonaa robotiikkavideota eri lähteistä, mukaan lukien GenRobot 10Kh RealOmni ja AgiBot World Beta, sekä 1,6 miljoonaa fysiikkavideota, joista 1,3 miljoonaa esikoulutuksesta ja 300 000 käsin kuratoitua. Verkkotunnussovituksen jälkeen malleille tehtiin toinen koulutusvaihe: vahvistusoppiminen palkkiomallilla K5-AV- ja K5-RO-malleille sekä SOAR-menetelmällä K5-PH-mallille. Julkaisu sisältää koodin ja painot MIT-lisenssillä. Artikkeli korostaa myös pitkän hännän dataongelmaa Physical AI:ssa, jossa harvinaiset skenaariot ovat kriittisiä mutta vaikeita kerätä, ja toteaa, että nykyisistä videogenerointimalleista puuttuu usein fyysinen tarkkuus, mikä edellyttää verkkotunnuskohtaista koulutusta ja jälkikoulutusta.
Lähde: Habr — хаб ML — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset