Mô hìnhMã nguồn mở 🇺🇸 24.07.2026 05:04

Poolside Releases Laguna S 2.1 — an Open-Weight Model for Agentic Coding That Punches Above Its Weight Class in SWE-Bench Multilingual

PoolsidePoolside DeepSeekDeepSeek NVIDIANVIDIA TencentTencent Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen AnthropicAnthropic
Poolside released Laguna S 2.1, an open-weight model with 11.8 billion parameters and 8 billion active per token, designed for agentic coding. Based on a Mixture-of-Experts (MoE) architecture, it supports up to 1 million tokens of context and can run on a single NVIDIA DGX Spark. Laguna S 2.1 ranks first among open models with known size on Terminal-Bench 2.1 (70.2%) and SWE-Bench Multilingual (78.5%), outperforming many larger competitors.
Poolside đã phát hành Laguna S 2.1, mô hình mã nguồn mở (open-weight) dành cho lập trình đại lý (agentic coding) với 118 tỷ tham số, trong đó khoảng 8 tỷ được kích hoạt cho mỗi token nhờ kiến trúc Mixture-of-Experts (MoE). Mô hình hỗ trợ ngữ cảnh lên tới 1 triệu token ở cả chế độ suy luận (reasoning mode) và không suy luận. Các trọng số được công bố trên Hugging Face theo giấy phép OpenMDW-1.1, và kích thước mô hình cho phép chạy trên một NVIDIA DGX Spark duy nhất. Trên các benchmark mã hóa đường dài, Laguna S 2.1 đạt kết quả tương đương với các mô hình lớn hơn nhiều lần, bao gồm DeepSeek-V4-Pro-Max, Nemotron 3 Ultra và Inkling. Ví dụ, trên SWE-Bench Multilingual, mô hình đạt 78,5%, đây là kết quả tốt nhất đã công bố trong số các mô hình mở. Trên Terminal-Bench 2.1 với chế độ suy luận được bật, kết quả đạt 70,2%. Trong khi đó, trên bài kiểm tra DeepSWE v1.1, mô hình đạt 40,4% so với 9,0% của DeepSeek-V4-Pro-Max với số tham số hoạt động ít hơn khoảng sáu lần. Mô hình có hai chế độ suy luận: tắt và tối đa (mặc định). Ở chế độ tối đa, mô hình tự xác định ngân sách tính toán, mang lại sự cải thiện trên DeepSWE từ 16,5% lên 40,4%, nhưng đổi lại là lượng token tăng (từ 99 nghìn lên 249 nghìn). Nhóm Poolside đã công bố ba quỹ đạo không chỉnh sửa của mô hình: tạo động cơ trình duyệt HTML/CSS hoạt động từ thư mục trống, tối ưu hóa động cơ đại lý của chính họ (tăng tốc 5,2% và giảm cấp phát bộ nhớ 71%), và tái khám phá độc lập giải pháp cho bài toán Erdos số 397 bằng Perl. Để triển khai, toàn bộ 118 tỷ tham số vẫn nằm trong bộ nhớ. Với lượng tử hóa 4-bit (NVFP4 hoặc INT4), trọng số chiếm khoảng 59 GB, vừa vặn trong bộ nhớ hợp nhất 128 GB của một DGX Spark. Với FP8, khoảng 118 GB (một Spark hoặc H200), với BF16, 236 GB (hai Spark hoặc một nút nhiều GPU). Quá trình huấn luyện bắt đầu vào ngày 22 tháng 5 năm 2026 trên 4096 NVIDIA H200 và mất chưa đầy chín tuần. Mô hình cũng có sẵn qua OpenRouter, vLLM, SGLang, Ollama và các nền tảng khác.
Nguồn: MarkTechPost — bản gốc
Bài viết liên quan trước đây ↓
Tin mới