Poolside представила Laguna S 2.1 — открытую агентную модель для кодинга с впечатляющими результатами на SWE-Bench Multilingual
Poolside
DeepSeek
NVIDIA
Tencent
Moonshot AI
Alibaba/Qwen
xAI
Anthropic
Компания Poolside выпустила Laguna S 2.1 — 118-миллиардную модель типа «смесь экспертов» (MoE) с 8B активных параметров на токен и контекстом до 1M токенов. Модель занимает первое место среди открытых моделей по тестам SWE-Bench Multilingual (78.5%) и Terminal-Bench 2.1 (70.2%), при этом в 4-битном формате работает на одном NVIDIA DGX Spark.
Poolside выпустила Laguna S 2.1 — открытую агентную модель для кодирования, построенную по архитектуре Mixture-of-Experts (MoE). При общем объёме в 118 миллиардов параметров, на каждый токен активируется лишь около 8B, что обеспечивает эффективность инференса. Модель поддерживает контекст до 1 миллиона токенов и может работать как с режимом размышления (thinking), так и без него. Веса доступны на Hugging Face под лицензией OpenMDW-1.1. На бенчмарке SWE-Bench Multilingual модель набрала 78,5%, что является лучшим результатом среди открытых моделей с опубликованным размером, опередив Tencent Hy3 (75,8%) и Qwen 3.7 Max (78,3%). На Terminal-Bench 2.1 результат с включённым thinking составил 70,2%, что также ставит модель на первое место в своей категории. Режим max thinking даёт значительный прирост: на Terminal-Bench 2.1 с 60,4% до 70,2%, а на DeepSWE — с 16,5% до 40,4%, однако ценой увеличения числа генерируемых токенов (например, на DeepSWE около 249K вместо 99K). В демонстрационных сценариях модель самостоятельно создала работающий HTML/CSS браузерный движок за 50 минут без вмешательства человека, оптимизировала собственный агентский фреймворк (ускорение на 5,2% и снижение выделения памяти на 71%), а также переоткрыла решение нерешённой задачи Эрдёша №397 на Perl за 68 минут. Для развёртывания: в 4-битном формате (NVFP4 или INT4) модель занимает около 59 ГБ и помещается на один DGX Spark с 128 ГБ унифицированной памяти; в FP8 — около 118 ГБ (один Spark или H200); в BF16 — 236 ГБ (требуется два Spark или мульти-GPU узел). Обучение заняло менее девяти недель на 4096 NVIDIA H200 GPU, начиная с 22 мая 2026 года. Это третья модель Poolside за три месяца. Доступ к модели предоставляется через OpenRouter (бесплатно до 256K контекста, платно до 1M по цене $0.10/$0.20/$0.01 на миллион входных/выходных/кэш-токенов), а также через Baseten, Kilo, Prime Intellect Prime Lab и ZML.
- Сокращения
- MoE = Mixture of Experts — смесь экспертов
- FP8 = Floating Point 8-bit — 8-битная плавающая точка
- INT4 = Integer 4-bit — 4-битное целое число
- BF16 = Bfloat16 — 16-битный формат с плавающей точкой Bfloat16
- NVFP4 = NVIDIA Floating Point 4-bit — 4-битная плавающая точка NVIDIA
- GGUF = GPT-Generated Unified Format — унифицированный формат GPT
- GPU = Graphics Processing Unit — графический процессор
- MLX = Metal Learning Extensions — расширения для обучения на Metal
- SWE-Bench = Software Engineering Benchmark — бенчмарк программной инженерии
- TRT-LLM = TensorRT-LLM — оптимизатор инференса TensorRT для больших языковых моделей
Источник: MarkTechPost —
оригинал
