Liquid AI ने LFM2.5-2.6B जारी किया: एक डिवाइस-आधारित एजेंटिक मॉडल जिसमें 128K कॉन्टेक्स्ट, टूल कॉलिंग, और ओपन वेट्स हैं
Liquid AI
Google/DeepMind
Alibaba/Qwen
Liquid AI ने LFM2.5-2.6B का अनावरण किया है, एक एजेंटिक मॉडल जो पूरी तरह से डिवाइस पर चलने के लिए डिज़ाइन किया गया है, जो योजना बनाने, टूल उपयोग और बहु-चरणीय कार्यों में सक्षम है। 2.69 बिलियन पैरामीटर, 128K कॉन्टेक्स्ट विंडो और ओपन वेट्स के साथ, यह बड़े मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्रदान करता है, साथ ही डेटा गोपनीयता और कम परिचालन लागत सुनिश्चित करता है।
लिक्विड एआई ने LFM2.5-2.6B जारी किया है, जो एक एजेंटिक मॉडल है जो पूरी तरह से डिवाइस पर चलता है, योजना बनाने, टूल कॉल करने और फोन, लैपटॉप, पीसी और रोबोट पर बहु-चरणीय कार्यों को संभालने में सक्षम है। मॉडल में कुल 2.69 बिलियन पैरामीटर, 131,072 टोकन की संदर्भ विंडो और 128,000 टोकन की शब्दावली है, जिसे लगभग 34 ट्रिलियन टोकन पर पूर्व-प्रशिक्षित किया गया है। दो चेकपॉइंट भेजे गए हैं: फाइन-ट्यूनिंग के लिए LFM2.5-2.6B-Base और एजेंटिक वर्कलोड के लिए पोस्ट-ट्रेंड LFM2.5-2.6B। चूंकि इंफ़ेरेंस स्थानीय रहता है, डेटा कभी भी डिवाइस से बाहर नहीं जाता है और प्रति रन सीमांत लागत लगभग शून्य है। मॉडल अपने आकार के लगभग चार गुना मॉडल के साथ प्रतिस्पर्धी टूल-उपयोग और निर्देश-पालन स्कोर की रिपोर्ट करता है। दोनों चेकपॉइंट lfm1.0 लाइसेंस के तहत हगिंग फेस पर सार्वजनिक हैं, वजन मूल, GGUF, MLX और ONNX प्रारूपों में है, और llama.cpp, vLLM, SGLang और LM Studio में पहले दिन से समर्थन है। आर्किटेक्चर में 30 परतें (22 डबल-गेटेड शॉर्ट कनवल्शन ब्लॉक और 8 ग्रुपेड-क्वेरी अटेंशन ब्लॉक) और शब्दावली का आकार 128,000 है। प्रशिक्षण में चार-चरणीय पोस्ट-ट्रेनिंग प्रक्रिया शामिल थी जिसमें पर्यवेक्षित फाइन-ट्यूनिंग, सुदृढीकरण सीखने के साथ शिक्षक विशेषज्ञता, मल्टी-डोमेन ऑन-पॉलिसी डिस्टिलेशन और GRPO के साथ एजेंटिक सुदृढीकरण सीखना शामिल था। बेंचमार्क से पता चलता है कि मॉडल सभी रिपोर्ट किए गए निर्देश-पालन बेंचमार्क और लगभग सभी टूल-उपयोग बेंचमार्क में आगे है, केवल BFCLv4 और कोडिंग कार्यों में Qwen3.5-9B जैसे बड़े मॉडल से पीछे है। मॉडल एजेंटिक वर्कलोड, टूल उपयोग, डेटा निष्कर्षण, RAG और लंबे-संदर्भ वर्कफ़्लो के लिए अनुशंसित है, लेकिन एजेंटिक कोडिंग या ज्ञान-भारी कार्यों के लिए नहीं।
स्रोत: MarkTechPost —
मूल
