Qwen3.8 Max: Mô hình mạnh nhất của Alibaba hay phán đoán hơn và tốn kém hơn cho mỗi tác vụ
Alibaba/Qwen
Anthropic
Moonshot AI
Qwen3.8 Max của Alibaba đạt 56 điểm trong Chỉ số Trí tuệ Phân tích Nhân tạo, cao hơn 10 điểm so với Qwen3.7 Max, ngang với Claude Opus 4.8. Tuy nhiên, mô hình này tốn kém hơn cho mỗi tác vụ (1,14 đô la so với 0,53 đô la) và có tỷ lệ ảo giác tăng cao (40% so với 23%) trong bài kiểm tra AA-Omniscience.
Qwen3.8 Max của Alibaba đạt 56 điểm trên Artificial Analysis Intelligence Index, cao hơn 10 điểm so với Qwen3.7 Max (46 điểm). Theo Artificial Analysis, mức điểm này tương đương Claude Opus 4.8, vượt qua GLM-5.2 (51 điểm), nhưng vẫn kém hơn Kimi K3 (57 điểm) – mô hình cũng có chi phí vận hành rẻ hơn 25%.
Trong bài kiểm tra công việc GDPval-AA, Qwen tăng 468 điểm Elo lên 1739, vượt qua Kimi K3 (1685 điểm), chỉ chịu thua Claude Opus 5 (1852 điểm). Qwen3.8 Max cần tới 64 bước xử lý cho mỗi tác vụ, thay vì 14 bước như trước, và số token đầu vào tăng gấp 15 lần do bài kiểm tra gửi lại toàn bộ lịch sử hội thoại ở mỗi bước. Mô hình này kỹ lưỡng hơn nhưng cũng chậm hơn và tốn kém hơn.
Dù giá token đã giảm (đầu vào 2 USD so với 2,50 USD, đầu ra 6 USD so với 7,50 USD, cache-hit 0,25 USD so với 0,50 USD trên mỗi triệu token), một tác vụ trong Intelligence Index vẫn tốn 1,14 USD, cao hơn gấp đôi so với mức 0,53 USD của Qwen3.7 Max. Trong khi đó, Kimi K3 chỉ tốn 0,86 USD nhưng đạt thêm một điểm, còn GLM-5.2 tốn 0,57 USD.
So với phiên bản tiền nhiệm, Qwen3.8 Max cũng bị giảm điểm ở bài kiểm tra AA-LCR (giảm 2 điểm) và AA-Omniscience (giảm 10 điểm). Tỷ lệ trả lời đúng vẫn duy trì ở mức khoảng 31%, nhưng tỷ lệ ảo giác (hallucination) lại tăng từ 23% lên 40%, đồng nghĩa với việc Qwen3.8 Max có xu hướng đoán bừa nhiều hơn là bỏ qua câu hỏi khi không chắc chắn.
Nguồn: The Decoder (DE) —
bản gốc
