В бенчмарке рабочих задач GDPval-AA Qwen прибавляет 468 очков по рейтингу Эло, поднимаясь до 1739, что превосходит Kimi K3 (1685); лучше показывает себя только Claude Opus 5 (1852). При этом Qwen3.8 Max требует 64 рабочих шага на задачу вместо 14, а количество входных токенов выросло в 15 раз, поскольку тест на каждом шаге заново отправляет всю историю переписки. Модель стала более тщательной, но при этом более медленной и дорогой. Хотя цены на токены снизились (входной токен — $2 против $2,50, выходной — $6 против $7,50, обращение к кэшу — $0,25 против $0,50 за миллион токенов), выполнение одной задачи в рамках Intelligence Index обходится в $1,14 — более чем вдвое дороже, чем $0,53 у Qwen3.7 Max. Для сравнения: Kimi K3 стоит $0,86 при на один балл более высоком результате, а GLM-5.2 — $0,57. По сравнению с предшественницей, Qwen3.8 Max также показывает регресс в тестах AA-LCR (-2 балла) и AA-Omniscience (-10 баллов). Доля правильных ответов держится на уровне около 31%, однако частота галлюцинаций выросла с 23% до 40% — то есть Qwen3.8 Max чаще выдаёт догадки вместо того, чтобы признать, что не знает ответа.