LFM2.5-VL-3B: एज डिवाइसों के लिए Liquid AI का नया विज़न-लैंग्वेज मॉडल
Liquid AI
Google/DeepMind
Alibaba/Qwen
Liquid AI ने LFM2.5-VL-3B जारी किया है, जो एक कॉम्पैक्ट विज़न-लैंग्वेज मॉडल है, जिसे डिवाइस पर कुशल इन्फरेंस के लिए डिज़ाइन किया गया है। यह स्क्रीन समझ, ग्राउंडिंग, मल्टी-इमेज रीज़निंग और फंक्शन कॉलिंग में सुधार प्रदान करता है। यह मॉडल कई बेंचमार्क में समान आकार के प्रतिस्पर्धियों से बेहतर प्रदर्शन करता है, जबकि सीपीयू और जीपीयू तैनाती के लिए अनुकूलित है।
Liquid AI ने एज डिवाइसों के लिए LFM2.5-VL-3B जारी करने की घोषणा की है, जो 3.1B पैरामीटर वाला विज़न-लैंग्वेज मॉडल है। यह कंपनी के LFM2.5-2.6B टेक्स्ट बैकबोन के साथ SigLIP2 400M NaFlex विज़न एनकोडर को जोड़ता है और इसे लगभग 34T टोकन पर प्रशिक्षित किया गया है, जिसमें पिछले संस्करणों की तुलना में चार गुना अधिक विज़न डेटा शामिल है। यह मॉडल कई विज़न बेंचमार्क्स में अपने आकार वर्ग में अत्याधुनिक परिणाम प्राप्त करता है, जिसमें स्क्रीन समझ, ग्राउंडिंग, और मल्टी-इमेज तर्क शामिल हैं। यह टेक्स्ट-ओनली कार्यों जैसे निर्देश पालन और टूल उपयोग में भी मजबूत प्रदर्शन दिखाता है। LFM2.5-VL-3B ऑन-डिवाइस इंफेरेंस के लिए अनुकूलित है, जो M5 Max पर 228 टोकन प्रति सेकंड, Ryzen AI Max+ 395 पर 116 टोकन प्रति सेकंड, और यहां तक कि Galaxy S26 Ultra पर 20 टोकन प्रति सेकंड की गति प्राप्त करता है। यह GPU पर कम विलंबता और उच्च थ्रूपुट के साथ मल्टी-फ्रेम इनपुट का समर्थन करता है, उच्च समवर्तीता पर लगभग 11K आउटपुट टोकन प्रति सेकंड प्राप्त करता है। यह मॉडल Hugging Face पर उपलब्ध है और transformers, vLLM, और llama.cpp सहित प्रमुख इंफेरेंस फ्रेमवर्क के साथ संगत है।
स्रोत: Hugging Face blog —
मूल
