ModelosNegocios y Mercado 🇩🇪 06.08.2026 16:01

Qwen3.8 Max: el modelo más fuerte de Alibaba adivina más a menudo y cuesta más por tarea

Alibaba/QwenAlibaba/Qwen AnthropicAnthropic Moonshot AIMoonshot AI
El Qwen3.8 Max de Alibaba alcanza 56 puntos en el Índice de Inteligencia Artificial Analysis, 10 más que el Qwen3.7 Max, empatando con Claude Opus 4.8. Sin embargo, es más caro por tarea ($1,14 frente a $0,53) y muestra tasas de alucinación más altas (40% frente a 23%) en la prueba AA-Omniscience.
El Qwen3.8 Max de Alibaba obtiene 56 puntos en el Índice de Inteligencia de Artificial Analysis, 10 puntos más que el Qwen3.7 Max (46). Según Artificial Analysis, está a la par del Claude Opus 4.8, por delante del GLM-5.2 (51), pero por detrás del Kimi K3 (57), que además opera un 25% más barato. En el benchmark laboral GDPval-AA, Qwen salta 468 puntos Elo hasta 1739, superando al Kimi K3 (1685), solo superado por el Claude Opus 5 (1852). El Qwen3.8 Max requiere 64 pasos de trabajo por tarea en lugar de 14, y los tokens de entrada aumentaron 15 veces porque la prueba reenvía todo el historial de la conversación en cada paso. El modelo es más minucioso pero más lento y costoso. Aunque los precios de los tokens han bajado (entrada $2 frente a $2.50, salida $6 frente a $7.50, caché acertada $0.25 frente a $0.50 por millón), una tarea en el Índice de Inteligencia cuesta $1.14, más del doble que los $0.53 del Qwen3.7 Max. El Kimi K3 cuesta $0.86 con un punto más, y el GLM-5.2 $0.57. En comparación con su predecesor, el Qwen3.8 Max también retrocede en AA-LCR (-2 puntos) y AA-Omniscience (-10 puntos). Su tasa de aciertos se mantiene alrededor del 31%, pero la tasa de alucinaciones aumenta del 23% al 40%, lo que significa que el Qwen3.8 Max adivina con más frecuencia en lugar de pasar.
Fuente: The Decoder (DE) — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas