Poolside Releases Laguna S 2.1 — an Open-Weight Model for Agentic Coding That Punches Above Its Weight Class in SWE-Bench Multilingual
Poolside
DeepSeek
NVIDIA
Tencent
Moonshot AI
Alibaba/Qwen
Anthropic
Poolside released Laguna S 2.1, an open-weight model with 11.8 billion parameters and 8 billion active per token, designed for agentic coding. Based on a Mixture-of-Experts (MoE) architecture, it supports up to 1 million tokens of context and can run on a single NVIDIA DGX Spark. Laguna S 2.1 ranks first among open models with known size on Terminal-Bench 2.1 (70.2%) and SWE-Bench Multilingual (78.5%), outperforming many larger competitors.
पूलसाइड ने लगुना एस 2.1 जारी किया है - यह एजेंटिक कोडिंग के लिए एक ओपन-वेट मॉडल है जिसमें 118 अरब पैरामीटर हैं, जिनमें से मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर के कारण प्रति टोकन लगभग 8 अरब सक्रिय होते हैं। मॉडल रिफ्लेक्शन मोड और बिना रिफ्लेक्शन दोनों में 1 मिलियन टोकन तक का कॉन्टेक्स्ट सपोर्ट करता है। वेट्स हगिंग फेस पर ओपनएमडीडब्ल्यू-1.1 लाइसेंस के तहत उपलब्ध हैं, और मॉडल का आकार इसे एक एकल NVIDIA DGX Spark पर चलाने की अनुमति देता है। लंबी अवधि के कोडिंग बेंचमार्क पर, लगुना एस 2.1 कई गुना बड़े मॉडलों के बराबर प्रदर्शन दिखाता है, जिसमें डीपसीक-V4-प्रो-मैक्स, नेमोट्रॉन 3 अल्ट्रा और इंकलिंग शामिल हैं। उदाहरण के लिए, SWE-बेंच मल्टीलिंगुअल पर मॉडल ने 78.5% स्कोर किया, जो ओपन-वेट मॉडल्स के बीच सबसे अच्छा प्रकाशित परिणाम है। टर्मिनल-बेंच 2.1 पर रिफ्लेक्शन मोड चालू करने पर 70.2% परिणाम मिला। वहीं, डीपSWE v1.1 परीक्षण पर मॉडल ने 40.4% प्राप्त किया, जबकि डीपसीक-V4-प्रो-मैक्स ने लगभग छह गुना कम सक्रिय पैरामीटर के साथ 9.0% प्राप्त किया। मॉडल में दो रिफ्लेक्शन मोड हैं: बंद और अधिकतम (डिफ़ॉल्ट)। अधिकतम मोड में, मॉडल स्वयं कम्प्यूटेशनल बजट निर्धारित करता है, जो डीपSWE पर 16.5% से 40.4% तक लाभ देता है, लेकिन टोकन की संख्या में वृद्धि (99k से 249k) की कीमत पर। पूलसाइड टीम ने मॉडल के तीन असंपादित ट्रैजेक्ट्री प्रकाशित किए: एक खाली फ़ोल्डर से एक कार्यशील HTML/CSS ब्राउज़र इंजन बनाना, अपने स्वयं के एजेंट इंजन को अनुकूलित करना (5.2% त्वरण और मेमोरी आवंटन में 71% कमी), और पर्ल में एर्डोश समस्या संख्या 397 के समाधान की स्वतंत्र रूप से पुनः खोज करना। डिप्लॉयमेंट के लिए, पूर्ण 118 अरब पैरामीटर मेमोरी में रहते हैं। 4-बिट क्वांटाइजेशन (NVFP4 या INT4) पर वेट्स लगभग 59 जीबी लेते हैं, जो एक DGX Spark की 128 जीबी यूनिफाइड मेमोरी में फिट हो जाता है। FP8 पर लगभग 118 जीबी (एक Spark या H200), BF16 पर 236 जीबी (दो Spark या मल्टी-GPU नोड)। प्रशिक्षण 22 मई 2026 को 4096 NVIDIA H200 पर शुरू हुआ और नौ सप्ताह से भी कम समय लगा। मॉडल OpenRouter, vLLM, SGLang, Ollama और अन्य प्लेटफ़ॉर्म के माध्यम से भी उपलब्ध है।
स्रोत: MarkTechPost —
मूल
