Poolside Releases Laguna S 2.1 — an Open-Weight Model for Agentic Coding That Punches Above Its Weight Class in SWE-Bench Multilingual
Poolside
DeepSeek
NVIDIA
Tencent
Moonshot AI
Alibaba/Qwen
Anthropic
Poolside released Laguna S 2.1, an open-weight model with 11.8 billion parameters and 8 billion active per token, designed for agentic coding. Based on a Mixture-of-Experts (MoE) architecture, it supports up to 1 million tokens of context and can run on a single NVIDIA DGX Spark. Laguna S 2.1 ranks first among open models with known size on Terminal-Bench 2.1 (70.2%) and SWE-Bench Multilingual (78.5%), outperforming many larger competitors.
Poolside выпустил Laguna S 2.1 — open-weight модель для агентного кодирования с 118 миллиардами параметров, из которых около 8 миллиардов активируются на каждый токен благодаря архитектуре Mixture-of-Experts (MoE). Модель поддерживает контекст до 1 миллиона токенов как в режиме размышления, так и без него. Веса доступны на Hugging Face под лицензией OpenMDW-1.1, а размер модели позволяет запускать её на одном NVIDIA DGX Spark. На бенчмарках длительного кодирования Laguna S 2.1 демонстрирует результаты, сопоставимые с моделями в несколько раз крупнее, включая DeepSeek-V4-Pro-Max, Nemotron 3 Ultra и Inkling. Например, на SWE-Bench Multilingual модель набрала 78,5%, что является лучшим опубликованным результатом среди моделей с открытым размером. На Terminal-Bench 2.1 с включённым режимом размышления результат составил 70,2%. При этом на тесте DeepSWE v1.1 модель получила 40,4% против 9,0% у DeepSeek-V4-Pro-Max при примерно в шесть раз меньшем количестве активных параметров. Модель имеет два режима размышления: выключен и максимальный (по умолчанию). В максимальном режиме модель сама определяет вычислительный бюджет, что даёт прирост на DeepSWE с 16,5% до 40,4%, но ценой увеличения количества токенов (с 99k до 249k). Команда Poolside опубликовала три неотредактированные траектории работы модели: создание работающего HTML/CSS браузерного движка из пустой папки, оптимизацию собственного агентского движка (ускорение на 5,2% и снижение выделения памяти на 71%), а также независимое переоткрытие решения проблемы Эрдёша №397 на Perl. Для развёртывания полные 118 миллиардов параметров остаются в памяти. При 4-битном квантовании (NVFP4 или INT4) веса занимают около 59 ГБ, что умещается в 128 ГБ унифицированной памяти одного DGX Spark. При FP8 — около 118 ГБ (один Spark или H200), при BF16 — 236 ГБ (два Spark или много-GPU узел). Обучение началось 22 мая 2026 года на 4096 NVIDIA H200 и заняло менее девяти недель. Модель также доступна через OpenRouter, vLLM, SGLang, Ollama и другие платформы.
Bron: MarkTechPost —
origineel
