Poolside 发布 Laguna S 2.1:一款开源权重模型,专为智能体编码设计,在 SWE-Bench Multilingual 中以小博大
Poolside
DeepSeek
NVIDIA
Tencent
Moonshot AI
Alibaba/Qwen
Anthropic
Poolside 发布了 Laguna S 2.1,这是一款开源权重模型,拥有 118 亿参数,每个 token 活跃参数为 80 亿,专为智能体编码设计。该模型基于混合专家(MoE)架构,支持高达 100 万 token 的上下文,并可在单个 NVIDIA DGX Spark 上运行。Laguna S 2.1 在 Terminal-Bench 2.1(70.2%)和 SWE-Bench Multilingual(78.5%)上,在已知规模的开源模型中排名第一,超越了众多更大的竞争对手。
Poolside发布了Laguna S 2.1——一款用于智能体编码的开放权重模型,拥有1180亿个参数,得益于混合专家(Mixture-of-Experts, MoE)架构,每个令牌仅激活约80亿个参数。该模型支持最多100万个令牌的上下文,既可在推理模式下也可在非推理模式下运行。权重以OpenMDW-1.1许可证在Hugging Face上提供,模型大小允许其在单个NVIDIA DGX Spark上运行。在长代码基准测试中,Laguna S 2.1的表现与比其大数倍的模型相当,包括DeepSeek-V4-Pro-Max、Nemotron 3 Ultra和Inkling。例如,在SWE-Bench Multilingual上,该模型得分为78.5%,这是开放尺寸模型中公布的最佳结果。在启用推理模式的Terminal-Bench 2.1上,得分为70.2%。同时,在DeepSWE v1.1测试中,该模型得分为40.4%,而DeepSeek-V4-Pro-Max为9.0%,但前者的活跃参数数量约为后者的六分之一。模型有两种推理模式:关闭和最大(默认)。在最大模式下,模型自行确定计算预算,使DeepSWE得分从16.5%提升至40.4%,但代价是令牌数量增加(从9.9万增至24.9万)。Poolside团队发布了三个未经编辑的模型运行轨迹:从空文件夹创建可运行的HTML/CSS浏览器引擎、优化自身智能体引擎(速度提升5.2%,内存分配减少71%),以及独立重新发现Erdős问题第397号的Perl解决方案。部署时,完整的1180亿个参数保留在内存中。在4位量化(NVFP4或INT4)下,权重占用约59 GB,可容纳于单个DGX Spark的128 GB统一内存中。在FP8下,约为118 GB(单个Spark或H200);在BF16下,为236 GB(两个Spark或多GPU节点)。训练始于2026年5月22日,使用了4096个NVIDIA H200,耗时不到九周。该模型也可通过OpenRouter、vLLM、SGLang、Ollama等平台访问。
来源: MarkTechPost —
原文
