Poolside publie Laguna S 2.1 — un modèle à poids ouverts pour le codage agentique qui surclasse sa catégorie dans SWE-Bench Multilingual
Poolside
DeepSeek
NVIDIA
Tencent
Moonshot AI
Alibaba/Qwen
Anthropic
Poolside a publié Laguna S 2.1, un modèle à poids ouverts avec 11,8 milliards de paramètres et 8 milliards d'actifs par jeton, conçu pour le codage agentique. Basé sur une architecture de mélange d'experts (MoE), il prend en charge jusqu'à 1 million de jetons de contexte et peut fonctionner sur un seul NVIDIA DGX Spark. Laguna S 2.1 se classe premier parmi les modèles ouverts de taille connue sur Terminal-Bench 2.1 (70,2 %) et SWE-Bench Multilingual (78,5 %), surpassant de nombreux concurrents plus grands.
Poolside a publié Laguna S 2.1, un modèle open-weight destiné au codage agentique, avec 118 milliards de paramètres dont environ 8 milliards activés par token grâce à l'architecture Mixture-of-Experts (MoE). Le modèle prend en charge un contexte allant jusqu'à 1 million de tokens, en mode réflexion ou non. Les poids sont disponibles sur Hugging Face sous licence OpenMDW-1.1, et la taille du modèle permet de l'exécuter sur un seul NVIDIA DGX Spark. Sur les benchmarks de codage long, Laguna S 2.1 obtient des résultats comparables à ceux de modèles plusieurs fois plus grands, notamment DeepSeek-V4-Pro-Max, Nemotron 3 Ultra et Inkling. Par exemple, sur SWE-Bench Multilingual, le modèle a obtenu 78,5 %, ce qui constitue le meilleur résultat publié parmi les modèles de taille ouverte. Sur Terminal-Bench 2.1 avec le mode réflexion activé, le résultat est de 70,2 %. Par ailleurs, sur le test DeepSWE v1.1, le modèle a obtenu 40,4 % contre 9,0 % pour DeepSeek-V4-Pro-Max, avec environ six fois moins de paramètres actifs. Le modèle dispose de deux modes de réflexion : désactivé et maximal (par défaut). En mode maximal, le modèle détermine lui-même le budget de calcul, ce qui permet une amélioration sur DeepSWE de 16,5 % à 40,4 %, mais au prix d'une augmentation du nombre de tokens (de 99 000 à 249 000). L'équipe de Poolside a publié trois trajectoires non éditées du modèle : la création d'un moteur de navigateur HTML/CSS fonctionnel à partir d'un dossier vide, l'optimisation de son propre moteur agentique (accélération de 5,2 % et réduction de l'allocation mémoire de 71 %), ainsi que la redécouverte indépendante de la solution au problème d'Erdős n° 397 en Perl. Pour le déploiement, les 118 milliards de paramètres complets restent en mémoire. Avec une quantification 4 bits (NVFP4 ou INT4), les poids occupent environ 59 Go, ce qui tient dans les 128 Go de mémoire unifiée d'un seul DGX Spark. En FP8, environ 118 Go (un Spark ou H200), en BF16, 236 Go (deux Spark ou un nœud multi-GPU). L'entraînement a débuté le 22 mai 2026 sur 4096 NVIDIA H200 et a duré moins de neuf semaines. Le modèle est également disponible via OpenRouter, vLLM, SGLang, Ollama et d'autres plateformes.
Source: MarkTechPost —
original
