Qwen3.8-27B open source : un agent de niveau Opus fonctionne sur un GPU grand public, surpasse Claude sur plusieurs benchmarks
Alibaba/Qwen
Anthropic
Le modèle Qwen3.8-27B d'Alibaba a été officiellement open source, avec 27 milliards de paramètres, un support multimodal natif et jusqu'à 1 million de tokens de contexte. Il surpasse Claude Opus 4.6 Max sur plusieurs benchmarks d'ingénierie logicielle et d'agents, permettant une exécution locale sur des GPU grand public haut de gamme. Le modèle inclut un effort de raisonnement réglable et des optimisations pour les tâches à long contexte.
Alibaba a publié le modèle open-source Qwen3.8-27B avec 27 milliards de paramètres. Sur les benchmarks officiels, il surpasse Claude Opus 4.6 Max dans les tâches d'ingénierie logicielle et d'agents, avec notamment une avance de 8,3 points sur SWE-bench Pro et de 15,2 points sur QwenSWEBench. Dans les évaluations d'agents, il obtient 70,7 sur CoWorkBench contre 68,2 pour Opus, et dans les tests multimodaux d'utilisation d'ordinateur et de téléphone, il atteint 84,3 sur OSWorld-Verified et 81,9 sur AndroidWorld, contre 72,7 et 62,0 pour Opus. Le modèle prend en charge la compréhension multimodale native, un contexte natif de 262 000 tokens extensible à 1 million, et inclut un réglage de l'effort de raisonnement (xhigh, medium, low) ainsi que l'option preserve_thinking pour les tâches d'agents. Son architecture utilise 48 couches d'attention linéaire Gated DeltaNet et 16 couches d'attention complète, permettant un contexte long. Il est compatible avec Transformers, vLLM, SGLang et TokenSpeed, et des versions quantifiées sont disponibles sur Hugging Face, permettant un déploiement sur des GPU grand public comme le RTX 3090/4090 ou les Mac Apple. Les tests de la communauté démontrent ses capacités de codage et multimodales, y compris une stabilité à haute concurrence sur NVIDIA GH200 et le traitement de vidéos longues.
Source: QbitAI 量子位 —
original
