3B मॉडल के NVIDIA और Google से बेहतर प्रदर्शन के बाद, Om AI ने एंड-साइड नेटिव VLX मॉडल लॉन्च किया: छोटे पैरामीटर भौतिक दुनिया की सटीक समझ हासिल करते हैं
NVIDIA
Google/DeepMind
Tesla
Om AI联汇 (Om AI Lianhui) ने Qianhai मदर फंड के नेतृत्व में कई सौ मिलियन युआन की फंडिंग पूरी की और दुनिया का पहला एंड-साइड नेटिव मॉडल VLX-Seek 1.5 ओपन-सोर्स किया। यह मॉडल, जो 3B और 10B संस्करणों में उपलब्ध है, स्ट्रीमिंग मल्टीमॉडल आर्किटेक्चर का उपयोग करता है और विभिन्न बेंचमार्क में बड़े मॉडलों से बेहतर प्रदर्शन दिखाता है, जो क्लाउड-आधारित से एंड-साइड नेटिव AI पर जोर देने वाले एक प्रतिमान बदलाव को उजागर करता है, जो भौतिक दुनिया की समझ के लिए है।
8 अगस्त को, Om AI Lianhui ने Qianhai Mother Fund के नेतृत्व में कई सौ मिलियन युआन की फंडिंग की घोषणा की, और साथ ही दुनिया का पहला एंड-साइड नेटिव मॉडल बताए जाने वाले VLX-Seek 1.5 को ओपन-सोर्स किया। कंपनी VLX को 'एंड-साइड नेटिव' दृष्टिकोण के रूप में स्थापित करती है, जो NVIDIA, Google और अन्य की क्लाउड-निर्भर रणनीतियों के विपरीत है। VLX-Seek 1.5 में 3B और 10B पैरामीटर वाले संस्करण हैं और इसमें एक स्ट्रीमिंग मल्टीमॉडल आर्किटेक्चर है जो पारंपरिक VLM बैच प्रोसेसिंग के विपरीत, डिवाइस पर वीडियो स्ट्रीम को वास्तविक समय में संसाधित करता है। बेंचमार्क में, 3B संस्करण ने LVIS Mean (57.5 बनाम 50.7), RefCOCOg test Mean (80.2 बनाम 76.8) और RefDrone F1 (73.2 बनाम 52.3) में NVIDIA के LocateAnything-3B को पीछे छोड़ दिया, और छोटी वस्तुओं और ड्रोन-दृश्य परिदृश्यों में महत्वपूर्ण सुधार दिखाए। मॉडल ने एक लक्ष्य भ्रम मीट्रिक भी पेश किया, जिसमें कम झूठी सकारात्मक दर (FP/GT 18 बनाम 71.3) हासिल की गई। कंपनी ने अपने 'एक दिमाग, कई रूप' एजेंट प्लेटफॉर्म OmAgent, एम्बेडेड परिदृश्यों के लिए OttoPlex, Lenovo और Apple के साथ विकसित OttoBox AI Studio, और लगभग 100,000 दृष्टिबाधित उपयोगकर्ताओं की सेवा करने वाले Homer AI पहनने योग्य दृश्य सहायक को भी उजागर किया। ओपन-सोर्सिंग का उद्देश्य भौतिक दुनिया के अनुप्रयोगों में एंड-साइड नेटिव AI के लिए एक मानक परिभाषित करना है।
स्रोत: QbitAI 量子位 —
मूल
