मॉडलओपन सोर्स 🇷🇺 04.08.2026 11:03

कैंडिंस्की WM 1.0: फिजिकल एआई के लिए जनरेटिव मॉडल

СберСбер NVIDIANVIDIA MetaMeta
Sber ने कैंडिंस्की WM 1.0 जारी किया है, जो स्वायत्त वाहनों, रोबोटिक्स और जटिल भौतिकी दृश्यों के लिए डिज़ाइन किए गए तीन इमेज-टू-वीडियो मॉडलों का एक सेट है। ये मॉडल, कैंडिंस्की 5.0 वीडियो लाइट पर आधारित हैं, एमआईटी लाइसेंस के तहत उपलब्ध हैं, और भौतिक रूप से सटीक सिंथेटिक वीडियो उत्पन्न करके फिजिकल एआई में डेटा की कमी को दूर करने का लक्ष्य रखते हैं।
Sber ने Kandinsky WM 1.0 को ओपन-सोर्स कर दिया है, जो फिजिकल AI के लिए तीन विशेष वीडियो जनरेशन मॉडलों का एक सेट है: K5-AV स्वायत्त वाहनों के लिए, K5-RO रोबोटिक्स के लिए, और K5-PH जटिल भौतिकी वाले दृश्यों के लिए। ये मॉडल 2 बिलियन पैरामीटर वाले Kandinsky 5.0 Video Lite पर आधारित हैं और इमेज-टू-वीडियो मोड में काम करते हैं, जिसमें पहला फ्रेम और एक टेक्स्ट प्रॉम्प्ट लेकर आगे का वीडियो जनरेट किया जाता है। प्रत्येक मॉडल को विशिष्ट डेटासेट पर डोमेन-अनुकूलित किया गया है: NVIDIA PhysicalAI Autonomous Vehicles से 1.5 मिलियन वीडियो, GenRobot 10Kh RealOmni और AgiBot World Beta सहित विभिन्न स्रोतों से 2.2 मिलियन रोबोटिक्स वीडियो, और 1.6 मिलियन भौतिकी वीडियो जिनमें से 1.3 मिलियन प्री-ट्रेनिंग से और 300,000 मैन्युअल रूप से क्यूरेट किए गए हैं। डोमेन अनुकूलन के बाद, मॉडलों को दूसरे प्रशिक्षण चरण से गुज़ारा गया: K5-AV और K5-RO के लिए रिवॉर्ड मॉडल के साथ RL, और K5-PH के लिए SOAR। रिलीज़ में MIT लाइसेंस के तहत कोड और वेट शामिल हैं। लेख में फिजिकल AI में लॉन्ग-टेल डेटा समस्या पर भी प्रकाश डाला गया है, जहाँ दुर्लभ परिदृश्य महत्वपूर्ण होते हैं लेकिन उन्हें इकट्ठा करना मुश्किल होता है, और यह नोट किया गया है कि वर्तमान वीडियो जनरेशन मॉडल में अक्सर भौतिकीय सटीकता की कमी होती है, जिससे डोमेन-विशिष्ट प्रशिक्षण और पोस्ट-ट्रेनिंग की आवश्यकता होती है।
स्रोत: Habr — хаб ML — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार