Poolside Releases Laguna S 2.1 — an Open-Weight Model for Agentic Coding That Punches Above Its Weight Class in SWE-Bench Multilingual
Poolside
DeepSeek
NVIDIA
Tencent
Moonshot AI
Alibaba/Qwen
Anthropic
Poolside released Laguna S 2.1, an open-weight model with 11.8 billion parameters and 8 billion active per token, designed for agentic coding. Based on a Mixture-of-Experts (MoE) architecture, it supports up to 1 million tokens of context and can run on a single NVIDIA DGX Spark. Laguna S 2.1 ranks first among open models with known size on Terminal-Bench 2.1 (70.2%) and SWE-Bench Multilingual (78.5%), outperforming many larger competitors.
Poolside merilis Laguna S 2.1 — model dengan bobot terbuka untuk pengkodean agen dengan 118 miliar parameter, di mana sekitar 8 miliar diaktifkan per token berkat arsitektur Mixture-of-Experts (MoE). Model ini mendukung konteks hingga 1 juta token baik dalam mode berpikir maupun tanpa mode tersebut. Bobot tersedia di Hugging Face di bawah lisensi OpenMDW-1.1, dan ukuran model memungkinkannya dijalankan pada satu NVIDIA DGX Spark. Pada tolok ukur pengkodean jangka panjang, Laguna S 2.1 menunjukkan hasil yang sebanding dengan model yang beberapa kali lebih besar, termasuk DeepSeek-V4-Pro-Max, Nemotron 3 Ultra, dan Inkling. Sebagai contoh, pada SWE-Bench Multilingual, model ini meraih 78,5%, yang merupakan hasil terbaik yang pernah dipublikasikan untuk model dengan ukuran terbuka. Pada Terminal-Bench 2.1 dengan mode berpikir diaktifkan, hasilnya adalah 70,2%. Sementara itu, pada tes DeepSWE v1.1, model ini mendapatkan 40,4% berbanding 9,0% pada DeepSeek-V4-Pro-Max dengan jumlah parameter aktif sekitar enam kali lebih sedikit. Model ini memiliki dua mode berpikir: mati dan maksimal (bawaan). Dalam mode maksimal, model sendiri menentukan anggaran komputasi, yang memberikan peningkatan pada DeepSWE dari 16,5% menjadi 40,4%, tetapi dengan mengorbankan peningkatan jumlah token (dari 99k menjadi 249k). Tim Poolside telah mempublikasikan tiga lintasan kerja model yang tidak diedit: membuat mesin peramban HTML/CSS yang berfungsi dari folder kosong, mengoptimalkan mesin agen mereka sendiri (percepatan 5,2% dan pengurangan alokasi memori sebesar 71%), serta menemukan kembali solusi untuk masalah Erdős No. 397 dalam bahasa Perl secara independen. Untuk penerapan, seluruh 118 miliar parameter tetap berada di memori. Dengan kuantisasi 4-bit (NVFP4 atau INT4), bobot memakan sekitar 59 GB, yang muat dalam memori terpadu 128 GB dari satu DGX Spark. Dengan FP8 — sekitar 118 GB (satu Spark atau H200), dengan BF16 — 236 GB (dua Spark atau node multi-GPU). Pelatihan dimulai pada 22 Mei 2026 pada 4096 NVIDIA H200 dan memakan waktu kurang dari sembilan minggu. Model ini juga tersedia melalui OpenRouter, vLLM, SGLang, Ollama, dan platform lainnya.
Sumber: MarkTechPost —
asli
