कैंडिंस्की WM 1.0: फिजिकल एआई के लिए जनरेटिव मॉडल
Сбер
NVIDIA
Meta
Sber ने कैंडिंस्की WM 1.0 जारी किया है, जो स्वायत्त वाहनों, रोबोटिक्स और जटिल भौतिकी दृश्यों के लिए डिज़ाइन किए गए तीन इमेज-टू-वीडियो मॉडलों का एक सेट है। ये मॉडल, कैंडिंस्की 5.0 वीडियो लाइट पर आधारित हैं, एमआईटी लाइसेंस के तहत उपलब्ध हैं, और भौतिक रूप से सटीक सिंथेटिक वीडियो उत्पन्न करके फिजिकल एआई में डेटा की कमी को दूर करने का लक्ष्य रखते हैं।
Sber ने Kandinsky WM 1.0 को ओपन-सोर्स कर दिया है, जो फिजिकल AI के लिए तीन विशेष वीडियो जनरेशन मॉडलों का एक सेट है: K5-AV स्वायत्त वाहनों के लिए, K5-RO रोबोटिक्स के लिए, और K5-PH जटिल भौतिकी वाले दृश्यों के लिए। ये मॉडल 2 बिलियन पैरामीटर वाले Kandinsky 5.0 Video Lite पर आधारित हैं और इमेज-टू-वीडियो मोड में काम करते हैं, जिसमें पहला फ्रेम और एक टेक्स्ट प्रॉम्प्ट लेकर आगे का वीडियो जनरेट किया जाता है। प्रत्येक मॉडल को विशिष्ट डेटासेट पर डोमेन-अनुकूलित किया गया है: NVIDIA PhysicalAI Autonomous Vehicles से 1.5 मिलियन वीडियो, GenRobot 10Kh RealOmni और AgiBot World Beta सहित विभिन्न स्रोतों से 2.2 मिलियन रोबोटिक्स वीडियो, और 1.6 मिलियन भौतिकी वीडियो जिनमें से 1.3 मिलियन प्री-ट्रेनिंग से और 300,000 मैन्युअल रूप से क्यूरेट किए गए हैं। डोमेन अनुकूलन के बाद, मॉडलों को दूसरे प्रशिक्षण चरण से गुज़ारा गया: K5-AV और K5-RO के लिए रिवॉर्ड मॉडल के साथ RL, और K5-PH के लिए SOAR। रिलीज़ में MIT लाइसेंस के तहत कोड और वेट शामिल हैं। लेख में फिजिकल AI में लॉन्ग-टेल डेटा समस्या पर भी प्रकाश डाला गया है, जहाँ दुर्लभ परिदृश्य महत्वपूर्ण होते हैं लेकिन उन्हें इकट्ठा करना मुश्किल होता है, और यह नोट किया गया है कि वर्तमान वीडियो जनरेशन मॉडल में अक्सर भौतिकीय सटीकता की कमी होती है, जिससे डोमेन-विशिष्ट प्रशिक्षण और पोस्ट-ट्रेनिंग की आवश्यकता होती है।
स्रोत: Habr — хаб ML —
मूल
