Poolside Releases Laguna S 2.1 — an Open-Weight Model for Agentic Coding That Punches Above Its Weight Class in SWE-Bench Multilingual
Poolside
DeepSeek
NVIDIA
Tencent
Moonshot AI
Alibaba/Qwen
Anthropic
Poolside released Laguna S 2.1, an open-weight model with 11.8 billion parameters and 8 billion active per token, designed for agentic coding. Based on a Mixture-of-Experts (MoE) architecture, it supports up to 1 million tokens of context and can run on a single NVIDIA DGX Spark. Laguna S 2.1 ranks first among open models with known size on Terminal-Bench 2.1 (70.2%) and SWE-Bench Multilingual (78.5%), outperforming many larger competitors.
Poolside가 Laguna S 2.1을 출시했습니다. 이 모델은 에이전트 코딩을 위한 오픈 웨이트 모델로, 1,180억 개의 파라미터를 가지고 있으며, Mixture-of-Experts 아키텍처 덕분에 토큰당 약 80억 개의 파라미터만 활성화됩니다. 이 모델은 추론 모드와 비추론 모드 모두에서 최대 100만 개의 토큰 컨텍스트를 지원합니다. 가중치는 Hugging Face에서 OpenMDW-1.1 라이선스로 제공되며, 모델 크기는 단일 NVIDIA DGX Spark에서 실행할 수 있을 정도입니다. 장기 코딩 벤치마크에서 Laguna S 2.1은 DeepSeek-V4-Pro-Max, Nemotron 3 Ultra, Inkling을 포함한 몇 배 더 큰 모델과 비슷한 결과를 보여줍니다. 예를 들어, SWE-Bench Multilingual에서 78.5%를 기록하여 오픈 사이즈 모델 중 가장 좋은 공개 결과를 달성했습니다. Terminal-Bench 2.1에서는 추론 모드를 활성화했을 때 70.2%를 기록했습니다. 한편, DeepSWE v1.1 테스트에서는 모델이 40.4%를 기록한 반면, DeepSeek-V4-Pro-Max는 약 6배 적은 활성 파라미터로 9.0%를 기록했습니다. 이 모델은 추론 모드가 꺼짐과 최대(기본값) 두 가지가 있습니다. 최대 모드에서는 모델이 자체적으로 계산 예산을 결정하며, DeepSWE에서 16.5%에서 40.4%로 성능이 향상되지만 토큰 수가 99k에서 249k로 증가합니다. Poolside 팀은 모델 작동의 편집되지 않은 세 가지 궤적을 공개했습니다: 빈 폴더에서 작동하는 HTML/CSS 브라우저 엔진 생성, 자체 에이전트 엔진 최적화(속도 5.2% 향상, 메모리 할당 71% 감소), 그리고 Perl로 에르되시 문제 397번에 대한 독립적인 재발견. 배포 시에는 전체 1,180억 개의 파라미터가 메모리에 유지됩니다. 4비트 양자화(NVFP4 또는 INT4)에서는 가중치가 약 59GB를 차지하여 단일 DGX Spark의 128GB 통합 메모리에 들어갑니다. FP8에서는 약 118GB(Spark 하나 또는 H200 하나), BF16에서는 236GB(Spark 두 개 또는 멀티 GPU 노드)입니다. 학습은 2026년 5월 22일 4096개의 NVIDIA H200에서 시작되어 9주 미만이 소요되었습니다. 이 모델은 OpenRouter, vLLM, SGLang, Ollama 및 기타 플랫폼을 통해서도 사용할 수 있습니다.
출처: MarkTechPost —
원문
