एएमडी ने Instella-MoE-16B-A3B जारी किया: Instinct GPUs पर प्रशिक्षित 2.8 बिलियन सक्रिय पैरामीटर वाला पूरी तरह से खुला Mixture-of-Experts LLM
एएमडी ने Instella-MoE-16B-A3B पेश किया, जो एक पूरी तरह से खुला Mixture-of-Experts भाषा मॉडल है जिसमें कुल 16 बिलियन पैरामीटर हैं और प्रति टोकन 2.8 बिलियन सक्रिय हैं। इसे शुरू से Instinct MI300X और MI325X GPUs पर प्रशिक्षित किया गया। रिलीज़ में वेट, डेटा मिश्रण, प्रशिक्षण कॉन्फ़िगरेशन और इन्फ्रेंस कोड शामिल हैं, जिसमें Gated Multi-head Latent Attention और FarSkip-Collective कनेक्टिविटी जैसी नवीन सुविधाएँ हैं।
AMD ने Instella-MoE-16B-A3B जारी किया है, जो एक पूरी तरह से खुला मिश्रित-विशेषज्ञ (Mixture-of-Experts) भाषा मॉडल है, जिसे Instinct MI300X और MI325X GPUs पर शुरू से प्रशिक्षित किया गया है। मॉडल में कुल 16 बिलियन पैरामीटर हैं, लेकिन प्रति टोकन केवल 2.8 बिलियन सक्रिय होते हैं, जिसमें 2 साझा विशेषज्ञ और प्रति MoE परत 64 में से चुने गए 6 रूटेड विशेषज्ञ शामिल हैं। AMD प्रत्येक प्रशिक्षण चरण से वजन, साथ ही डेटा मिश्रण, प्रशिक्षण कॉन्फ़िगरेशन और अनुमान कोड प्रकाशित कर रहा है। दो प्रमुख संरचनात्मक विकल्प हैं गेटेड मल्टी-हेड लेटेंट अटेंशन (Gated Multi-head Latent Attention), जो एक हल्का सीखा हुआ आउटपुट गेट जोड़ता है, और FarSkip-Collective, जो विशेषज्ञ-समानांतर संचार को गणना के साथ ओवरलैप करता है। AMD 12.7% प्री-ट्रेनिंग गति वृद्धि और विशेषज्ञ समानांतरता के साथ सेवा देते समय पहले टोकन के समय में 39.2% तक की कमी की रिपोर्ट करता है। मॉडल को खुले कॉर्पोरा से 7.1 ट्रिलियन टोकन पर प्री-ट्रेन किया गया था, मध्य-प्रशिक्षण में Dolma3 Dolmino 100B का उपयोग किया गया था, और एक लंबी-संदर्भ अवस्था जो YaRN का उपयोग करके विंडो को 4K से 64K तक बढ़ाती है। पोस्ट-ट्रेनिंग में Miles फ्रेमवर्क में SFT, DPO और RL शामिल हैं। आधार चेकपॉइंट औसत 76.7 है, जो पूरी तरह से खुले मॉडलों में सबसे मजबूत है, Moonlight-16B-A3B (76.2) और अन्य से आगे। वजन केवल शैक्षणिक और अनुसंधान उद्देश्यों के लिए ResearchRAIL लाइसेंस के अंतर्गत हैं, जबकि प्रशिक्षण कोडबेस MIT लाइसेंस प्राप्त है।
स्रोत: MarkTechPost —
मूल
