Alibaba Qwen2.5-1M का सोर्स कोड जारी, 1 मिलियन टोकन तक कॉन्टेक्स्ट सपोर्ट
Alibaba/Qwen
अलीबाबा ने Qwen2.5-7B-Instruct-1M और Qwen2.5-14B-Instruct-1M मॉडल जारी किए हैं, जो 1 मिलियन टोकन तक का कॉन्टेक्स्ट सपोर्ट करते हैं। साथ ही, vLLM पर आधारित एक अनुकूलित इन्फ़रेंस फ्रेमवर्क भी जारी किया। ये मॉडल लंबे कॉन्टेक्स्ट वाले कार्यों में पिछले संस्करणों और GPT-4o-mini से बेहतर प्रदर्शन करते हैं, जबकि छोटे टेक्स्ट पर भी प्रभावी रहते हैं।
Alibaba Qwen ने Qwen2.5-7B-Instruct-1M और Qwen2.5-14B-Instruct-1M ओपन मॉडल पेश किए हैं, जो 1 मिलियन टोकन तक के कॉन्टेक्स्ट को प्रोसेस करने में सक्षम हैं। इन्हें डिप्लॉय करने के लिए कंपनी ने vLLM पर आधारित इन्फरेंस फ्रेमवर्क पूरी तरह से ओपन कर दिया है, जो स्पार्स अटेंशन का उपयोग करता है और 1M टोकन की प्रोसेसिंग को 3 से 7 गुना तेज करता है। मॉडलों को प्रोग्रेसिवली ट्रेन किया गया: पहले 256K टोकन तक के सीक्वेंस पर, और फिर ड्यअल चंक अटेंशन नामक लंबाई एक्सट्रापोलेशन तकनीक से इसे बढ़ाकर 1M तक किया गया। पासकी रिट्रीवल और जटिल टास्कों (जैसे RULER, LV-Eval, LongBench) के परीक्षणों में, ये मॉडल 128K वाले संस्करणों और GPT-4o-mini से काफी बेहतर प्रदर्शन करते हैं। इन्फरेंस के लिए Ampere या Hopper आर्किटेक्चर वाले GPU की सिफारिश की जाती है, जिसमें 7B के लिए कम से कम 120 GB VRAM और 14B के लिए 320 GB की आवश्यकता है। इसके अलावा, लंबे कॉन्टेक्स्ट को सपोर्ट करने वाला AI असिस्टेंट Qwen Chat भी पेश किया गया है।
स्रोत: Alibaba Qwen —
मूल
