MallitAvoin lähdekoodi 🇺🇸 24.07.2026 05:04

Poolside julkaisee Laguna S 2.1 -mallin – avoimen painoarvon malli agenttipohjaiseen ohjelmointiin, joka ylittää painoluokkansa SWE-Bench Multilingual -testissä

PoolsidePoolside DeepSeekDeepSeek NVIDIANVIDIA TencentTencent Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen AnthropicAnthropic
Poolside julkaisi Laguna S 2.1 -mallin, jossa on 11,8 miljardia parametria ja 8 miljardia aktiivista parametria tokenia kohden. Se on suunniteltu agenttipohjaiseen ohjelmointiin. Se perustuu Mixture-of-Experts (MoE) -arkkitehtuuriin, tukee enintään 1 miljoonan tokenin kontekstia ja voi toimia yhdellä NVIDIA DGX Spark -laitteella. Laguna S 2.1 on ensimmäisellä sijalla avoimien mallien joukossa, joiden koko tunnetaan, Terminal-Bench 2.1 (70,2 %) ja SWE-Bench Multilingual (78,5 %) -testeissä, ja se päihittää monet suuremmat kilpailijat.
Poolside выпустил Laguna S 2.1 — open-weight модель для агентного кодирования с 118 миллиардами параметров, из которых около 8 миллиардов активируются на каждый токен благодаря архитектуре Mixture-of-Experts (MoE). Модель поддерживает контекст до 1 миллиона токенов как в режиме размышления, так и без него. Веса доступны на Hugging Face под лицензией OpenMDW-1.1, а размер модели позволяет запускать её на одном NVIDIA DGX Spark. На бенчмарках длительного кодирования Laguna S 2.1 демонстрирует результаты, сопоставимые с моделями в несколько раз крупнее, включая DeepSeek-V4-Pro-Max, Nemotron 3 Ultra и Inkling. Например, на SWE-Bench Multilingual модель набрала 78,5%, что является лучшим опубликованным результатом среди моделей с открытым размером. На Terminal-Bench 2.1 с включённым режимом размышления результат составил 70,2%. При этом на тесте DeepSWE v1.1 модель получила 40,4% против 9,0% у DeepSeek-V4-Pro-Max при примерно в шесть раз меньшем количестве активных параметров. Модель имеет два режима размышления: выключен и максимальный (по умолчанию). В максимальном режиме модель сама определяет вычислительный бюджет, что даёт прирост на DeepSWE с 16,5% до 40,4%, но ценой увеличения количества токенов (с 99k до 249k). Команда Poolside опубликовала три неотредактированные траектории работы модели: создание работающего HTML/CSS браузерного движка из пустой папки, оптимизацию собственного агентского движка (ускорение на 5,2% и снижение выделения памяти на 71%), а также независимое переоткрытие решения проблемы Эрдёша №397 на Perl. Для развёртывания полные 118 миллиардов параметров остаются в памяти. При 4-битном квантовании (NVFP4 или INT4) веса занимают около 59 ГБ, что умещается в 128 ГБ унифицированной памяти одного DGX Spark. При FP8 — около 118 ГБ (один Spark или H200), при BF16 — 236 ГБ (два Spark или много-GPU узел). Обучение началось 22 мая 2026 года на 4096 NVIDIA H200 и заняло менее девяти недель. Модель также доступна через OpenRouter, vLLM, SGLang, Ollama и другие платформы.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset