Qwen3.8 Max: o modelo mais forte da Alibaba adivinha com mais frequência e custa mais por tarefa
Alibaba/Qwen
Anthropic
Moonshot AI
O Qwen3.8 Max da Alibaba alcança 56 pontos no Índice de Inteligência da Artificial Analysis, 10 a mais que o Qwen3.7 Max, empatando com o Claude Opus 4.8. No entanto, é mais caro por tarefa (US$ 1,14 contra US$ 0,53) e apresenta taxas maiores de alucinação (40% contra 23%) no teste AA-Omniscience.
O Qwen3.8 Max da Alibaba obtém 56 pontos no Índice de Inteligência Artificial Analysis, 10 pontos a mais que o Qwen3.7 Max (46). De acordo com a Artificial Analysis, está no mesmo nível do Claude Opus 4.8, à frente do GLM-5.2 (51), mas atrás do Kimi K3 (57), que também opera 25% mais barato. No benchmark de trabalho GDPval-AA, o Qwen salta 468 Elo para 1739, superando o Kimi K3 (1685), com apenas o Claude Opus 5 (1852) melhor. O Qwen3.8 Max exige 64 etapas de trabalho por tarefa, em vez de 14, e os tokens de entrada aumentaram 15 vezes porque o teste reenvia todo o histórico da conversa a cada etapa. O modelo é mais minucioso, porém mais lento e mais caro. Embora os preços dos tokens tenham caído (entrada $2 vs $2,50, saída $6 vs $7,50, cache hit $0,25 vs $0,50 por milhão), uma tarefa no Índice de Inteligência custa $1,14, mais que o dobro dos $0,53 do Qwen3.7 Max. O Kimi K3 custa $0,86 com um ponto a mais, e o GLM-5.2 $0,57. Em comparação com seu antecessor, o Qwen3.8 Max também regride no AA-LCR (menos 2 pontos) e no AA-Omniscience (menos 10 pontos). Sua taxa de acerto permanece em torno de 31%, mas a taxa de alucinação sobe de 23% para 40%, o que significa que o Qwen3.8 Max adivinha com mais frequência em vez de passar a vez.
Fonte: The Decoder (DE) —
original
