रोबोटिक्समॉडल 🇨🇳 12.08.2026 06:01

रोबोट ब्रेन रेस गहरे पानी में: भौतिक दुनिया के लिए शुरू से मॉडल डिजाइन करने की आवश्यकता क्यों है

2025 WAIC में, एम्बोडेड AI केंद्र में रहा, जिसमें 200 से अधिक कंपनियों ने प्रदर्शन किया, जो प्रदर्शन रोबोटों से हैंडलिंग और निरीक्षण जैसे व्यावहारिक अनुप्रयोगों पर ध्यान केंद्रित कर रहा है। एंट लिंगबो के मुख्य वैज्ञानिक, शेन युजुन, तर्क देते हैं कि डिजिटल दुनिया के वीडियो मॉडल को फाइन-ट्यूनिंग के माध्यम से रोबोटों में अनुकूलित करना एक पथ-निर्भर शॉर्टकट है, अंतिम समाधान नहीं, और भौतिक वास्तविकता के लिए शुरू से डिजाइन किए गए मॉडल के साथ 'एम्बोडेड-नेटिव' दृष्टिकोण की वकालत करते हैं। कंपनी ने छह मॉडलों के साथ अपना फुल-स्टैक ब्रेन 2.0 अनावरण किया, जिसमें उद्योग का पहला एम्बोडेड-नेटिव वर्ल्ड-एक्शन मॉडल भी शामिल है, और 1.5 अरब युआन जुटाने के लक्ष्य के साथ एक वित्तपोषण दौर की घोषणा की।
WAIC (वर्ल्ड आर्टिफिशियल इंटेलिजेंस कॉन्फ्रेंस) में दिए एक इंटरव्यू में, Ant Lingbo के चीफ साइंटिस्ट Shen Yujun ने एम्बॉडिड इंटेलिजेंस से जुड़ी चुनौतियों पर चर्चा की। उन्होंने इस बात पर ज़ोर दिया कि डेटा स्टैंडर्ड्स अभी तक एकसमान नहीं हो पाए हैं, क्योंकि तकनीकी दिशा अभी तय नहीं हुई है — मॉडैलिटी, प्रिसिजन या क्वालिटी को लेकर कोई सर्वसम्मति नहीं बनी है। उन्होंने बताया कि रियल डेटा, खासतौर पर रोबोट्स से मिलने वाला टेलीऑपरेशन डेटा और इंसानों का फर्स्ट-पर्सन डेटा, जनरल-पर्पज़ रोबोट्स के लिए सिमुलेशन डेटा से कहीं ज़्यादा अहम है, क्योंकि सिमुलेशन इंसानों की अवचेतन (सबकॉन्शियस) गतिविधियों को दोहरा पाने में सक्षम नहीं हैं। Lingbo की रणनीति एक ही एंड-टू-एंड मॉडल बनाने की जल्दबाज़ी करने के बजाय कई अलग-अलग मॉडल्स (जैसे LingBot-Vision, LingBot-Depth, LingBot-Video, LingBot-VLA और LingBot-VA) विकसित करने पर केंद्रित है, ताकि विशिष्ट तकनीकी समस्याओं को हल किया जा सके — जैसे मॉडैलिटीज़ को एलाइन करना, डायनामिक्स की भविष्यवाणी करना, और MoE (मिक्सचर ऑफ एक्सपर्ट्स) आर्किटेक्चर में लोड बैलेंसिंग सुनिश्चित करना। Shen ने 'एम्बॉडिड-नेटिव' मॉडल्स की अवधारणा पेश की, जिसके तहत भौतिक दुनिया के कार्यों के अनुरूप नेटिव डेटा, रियल-टाइम इंटरैक्शन के लिए उपयुक्त मॉडल क्षमताएं, और शुरू से (स्क्रैच से) ट्रेनिंग की क्षमता ज़रूरी है। उन्होंने DINO जैसे सेल्फ-सुपरवाइज़्ड विज़न मॉडल्स को दोहराने और वन-वे अटेंशन के लिए कॉज़ल मॉडलिंग को लागू करने में आने वाली दिक्कतों का भी ज़िक्र किया। सुरक्षा के मुद्दे पर उन्होंने ज़ोर देकर कहा कि केवल 'फेंस-बेस्ड' सुरक्षा (यानी कार्रवाइयों को सीमित करना) पर्याप्त नहीं है, बल्कि प्रीट्रेनिंग के दौरान ही 'नेटिव सेफ्टी' को शामिल किया जाना चाहिए, ठीक वैसे ही जैसे इंसानों में सहज प्रवृत्तियां (इंस्टिंक्ट्स) होती हैं। उन्होंने यह भी भविष्यवाणी की कि एम्बॉडिड AI के लिए 'ChatGPT मोमेंट' तब आएगा जब आम लोग आसानी से डेटा कलेक्शन में हिस्सा ले सकेंगे, जिससे रोबोट्स वाकई फायदेमंद बनेंगे और रोज़मर्रा की ज़िंदगी का हिस्सा बन जाएंगे।
स्रोत: InfoQ 中国 — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार