ModelosCódigo Abierto 🇺🇸 24.07.2026 05:04

Poolside lanza Laguna S 2.1 — un modelo de pesos abiertos para codificación agéntica que rinde por encima de su categoría en SWE-Bench Multilingüe

PoolsidePoolside DeepSeekDeepSeek NVIDIANVIDIA TencentTencent Moonshot AIMoonshot AI Alibaba/QwenAlibaba/Qwen AnthropicAnthropic
Poolside lanzó Laguna S 2.1, un modelo de pesos abiertos con 11,8 mil millones de parámetros y 8 mil millones activos por token, diseñado para codificación agéntica. Basado en una arquitectura de Mezcla de Expertos (MoE), admite hasta 1 millón de tokens de contexto y puede ejecutarse en un solo NVIDIA DGX Spark. Laguna S 2.1 ocupa el primer lugar entre los modelos abiertos con tamaño conocido en Terminal-Bench 2.1 (70,2%) y SWE-Bench Multilingüe (78,5%), superando a muchos competidores más grandes.
Poolside ha lanzado Laguna S 2.1, un modelo de pesos abiertos para codificación agente con 118 mil millones de parámetros, de los cuales aproximadamente 8 mil millones se activan por token gracias a la arquitectura Mixture-of-Experts (MoE). El modelo admite un contexto de hasta 1 millón de tokens tanto en modo de razonamiento como sin él. Los pesos están disponibles en Hugging Face bajo la licencia OpenMDW-1.1, y el tamaño del modelo permite ejecutarlo en un solo NVIDIA DGX Spark. En benchmarks de codificación de larga duración, Laguna S 2.1 muestra resultados comparables a modelos varias veces más grandes, incluyendo DeepSeek-V4-Pro-Max, Nemotron 3 Ultra e Inkling. Por ejemplo, en SWE-Bench Multilingual obtuvo un 78,5%, que es el mejor resultado publicado entre modelos de tamaño abierto. En Terminal-Bench 2.1 con el modo de razonamiento activado, el resultado fue del 70,2%. Además, en la prueba DeepSWE v1.1, el modelo alcanzó un 40,4% frente al 9,0% de DeepSeek-V4-Pro-Max, con aproximadamente seis veces menos parámetros activos. El modelo tiene dos modos de razonamiento: desactivado y máximo (por defecto). En modo máximo, el modelo determina por sí mismo el presupuesto computacional, lo que mejora el rendimiento en DeepSWE del 16,5% al 40,4%, pero a costa de aumentar la cantidad de tokens (de 99k a 249k). El equipo de Poolside ha publicado tres trayectorias no editadas del trabajo del modelo: creación de un motor de navegador HTML/CSS funcional desde una carpeta vacía, optimización de su propio motor agente (aceleración del 5,2% y reducción de la asignación de memoria en un 71%), y redescubrimiento independiente de la solución al problema de Erdős número 397 en Perl. Para el despliegue, los 118 mil millones de parámetros completos permanecen en memoria. Con cuantización de 4 bits (NVFP4 o INT4), los pesos ocupan unos 59 GB, lo que cabe en los 128 GB de memoria unificada de un solo DGX Spark. Con FP8, unos 118 GB (un Spark o H200); con BF16, 236 GB (dos Spark o un nodo multi-GPU). El entrenamiento comenzó el 22 de mayo de 2026 en 4096 NVIDIA H200 y duró menos de nueve semanas. El modelo también está disponible a través de OpenRouter, vLLM, SGLang, Ollama y otras plataformas.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas