ModèlesAffaires et Marché 🇩🇪 06.08.2026 16:01

Qwen3.8 Max : le modèle le plus puissant d'Alibaba devine plus souvent et coûte plus cher par tâche

Alibaba/QwenAlibaba/Qwen AnthropicAnthropic Moonshot AIMoonshot AI
Le Qwen3.8 Max d'Alibaba atteint 56 points dans l'indice d'intelligence Artificielle Analysis, soit 10 de plus que le Qwen3.7 Max, à égalité avec Claude Opus 4.8. Cependant, il est plus cher par tâche (1,14 $ contre 0,53 $) et présente des taux d'hallucination accrus (40 % contre 23 %) sur le test AA-Omniscience.
Le Qwen3.8 Max d'Alibaba obtient un score de 56 à l'indice d'intelligence d'Artificial Analysis, soit 10 points de plus que le Qwen3.7 Max (46). Selon Artificial Analysis, il est au niveau du Claude Opus 4.8, devant le GLM-5.2 (51), mais derrière le Kimi K3 (57), qui est également 25 % moins cher. Dans le benchmark de travail GDPval-AA, Qwen gagne 468 points Elo pour atteindre 1739, dépassant le Kimi K3 (1685), seul le Claude Opus 5 (1852) faisant mieux. Le Qwen3.8 Max nécessite 64 étapes de travail par tâche au lieu de 14, et les tokens d'entrée ont été multipliés par 15, car le test renvoie l'intégralité de l'historique de conversation à chaque étape. Le modèle est plus approfondi, mais plus lent et plus coûteux. Bien que les prix des tokens aient baissé (entrée 2 $ contre 2,50 $, sortie 6 $ contre 7,50 $, cache hit 0,25 $ contre 0,50 $ par million), une tâche de l'indice d'intelligence coûte 1,14 $, soit plus du double des 0,53 $ du Qwen3.7 Max. Le Kimi K3 coûte 0,86 $ avec un point de plus, le GLM-5.2 0,57 $. Par rapport à son prédécesseur, le Qwen3.8 Max régresse également sur AA-LCR (-2 points) et AA-Omniscience (-10 points). Son taux de réussite reste autour de 31 %, mais le taux d'hallucination passe de 23 % à 40 %, ce qui signifie que le Qwen3.8 Max devine plus souvent au lieu de passer.
Source: The Decoder (DE) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches