मॉडलशोध 🇨🇳 05.08.2026 12:01

Ming-Flash-Omni: एकीकृत पूर्ण-मोडलिटी मॉडल की प्रमुख तकनीकें और अभ्यास

क्यूकॉन बीजिंग 2026 में, एंट ग्रुप के वरिष्ठ एल्गोरिदम विशेषज्ञ गुओ किंगपेई ने Ming-Flash-Omni, एक हजार-अरब पैरामीटर वाले पूर्ण-मोडलिटी एकीकृत मॉडल के विकास पर विस्तार से चर्चा की। वार्ता में मल्टी-राउटर और AnyExperts के साथ एकीकृत आर्किटेक्चर, सहयोगात्मक प्रशिक्षण रणनीति और इंजीनियरिंग अनुकूलन शामिल थे, जिससे सभी मोडैलिटी में अत्याधुनिक परिणाम प्राप्त हुए।
QCon ग्लोबल सॉफ्टवेयर डेवलपमेंट कॉन्फ्रेंस 2026 बीजिंग में Ant Group के Guo Qingpei ने Ming-Flash-Omni के पीछे की तकनीकी संरचना और व्यावहारिक अनुभवों को प्रस्तुत किया, जो सैकड़ों अरब पैरामीटर वाला एक पूर्ण-मोडैलिटी एकीकृत मॉडल है। यह मॉडल ऑडियो, वीडियो, इमेज और टेक्स्ट की समझ को जनरेशन कार्यों के साथ एक ही फ्रेमवर्क में एकीकृत करता है। मोडैलिटी एकीकरण की चुनौती से निपटने के लिए, टीम ने एक मल्टी-राउटर मैकेनिज्म डिज़ाइन किया जो मोडैलिटी-विशिष्ट एक्सपर्ट राउटिंग को संभालता है, साथ ही AnyExperts विकसित किया, जो टोकन की महत्ता के आधार पर गतिशील रूप से एक्सपर्ट्स आवंटित करता है और इमेज व वीडियो टोकन में अतिरेक (redundancy) को कम करता है। उन्होंने डेटा अनुपात योजना और अभिसरण (convergence) की गति के आधार पर गतिशील लर्निंग रेट समायोजन के साथ एक सहयोगी प्रशिक्षण रणनीति भी पेश की। कार्य (task) एकीकरण के लिए, टीम ने एक फ्रोज़न मल्टीमॉडल अंडरस्टैंडिंग बैकबोन पर निर्माण करते हुए इमेज जनरेशन और स्पीच सिंथेसिस क्षमताएं जोड़ीं, जिन्हें जेनरेटिव सेगमेंटेशन प्रशिक्षण के माध्यम से सूक्ष्म दृश्य ज्ञान, पहचान संरक्षण के लिए एक डुअल-स्ट्रीम सूचना दृष्टिकोण, और टाइपोग्राफिक फीचर्स के अलग निष्कर्षण से पूरक किया गया ताकि टेक्स्ट में गड़बड़ी (garbled text) न हो। स्पीच जनरेशन को डायलेक्ट, भावना और कस्टम टिंबर नियंत्रणों के साथ-साथ स्पीच, ध्वनि और संगीत के एक साथ जनरेशन से बेहतर बनाया गया। इस मॉडल ने विभिन्न मोडैलिटी में अत्याधुनिक (state-of-the-art) परिणाम हासिल किए, जो विशेष मॉडलों के बराबर या उनसे बेहतर रहे, और यह अपनी तरह का पहला ओपन-सोर्स हज़ार-अरब-पैरामीटर पूर्ण-मोडैलिटी एकीकृत मॉडल है। इंजीनियरिंग अनुकूलन में एक पूर्ण-मोडैलिटी सीक्वेंस पैकिंग योजना और लचीली समानांतर (parallel) रणनीतियां शामिल थीं, जिनसे प्रशिक्षण दक्षता में 67% का सुधार हुआ। टीम ने ओपन-सोर्स प्रोजेक्ट्स MingTok और MingTok-Audio के साथ प्रतिनिधित्व-स्तर (representation-level) के एकीकरण की भी खोज की, जो इमेज और ऑडियो दोनों की समझ और जनरेशन के लिए एक एकीकृत फ्रेमवर्क को प्रदर्शित करते हैं।
स्रोत: InfoQ 中国 — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार