Modellerİş ve Pazar 🇩🇪 06.08.2026 16:01

Qwen3.8 Max: Alibaba'nın en güçlü modeli daha sık tahmin yürütüyor ve görev başına maliyeti artıyor

Alibaba/QwenAlibaba/Qwen AnthropicAnthropic Moonshot AIMoonshot AI
Alibaba'nın Qwen3.8 Max'i, Yapay Zeka Analiz Endeksi'nde 56 puan alarak Qwen3.7 Max'ten 10 puan daha yüksek bir skor elde etti ve Claude Opus 4.8 ile eşitlendi. Ancak görev başına maliyeti (1,14 dolar ile 0,53 dolar) daha yüksek ve AA-Omniscience testinde halüsinasyon oranı arttı (%23'ten %40'a).
Alibaba'nın Qwen3.8 Max modeli, Yapay Zeka Analizi Endeksi'nde 56 puan alarak Qwen3.7 Max'in (46) 10 puan üzerine çıktı. Yapay Zeka Analizi'ne göre, Claude Opus 4.8 ile eşit seviyede, GLM-5.2'nin (51) önünde, ancak %25 daha ucuz olan Kimi K3'ün (57) gerisinde. GDPval-AA iş kıyaslamasında Qwen, 468 Elo artışla 1739'a yükselerek Kimi K3'ü (1685) geride bıraktı; yalnızca Claude Opus 5 (1852) daha iyi durumda. Qwen3.8 Max, görev başına 14 yerine 64 çalışma adımı gerektiriyor ve giriş token sayısı 15 kat arttı çünkü test her adımda tüm konuşma geçmişini yeniden gönderiyor. Model daha titiz ancak daha yavaş ve maliyetli. Token fiyatları düşmüş olsa da (giriş 2 dolar yerine 2,50 dolar, çıkış 6 dolar yerine 7,50 dolar, önbellek isabeti 0,25 dolar yerine 0,50 dolar), Zeka Endeksi'ndeki bir görev 1,14 dolara mal oluyor; bu, Qwen3.7 Max'in 0,53 dolarının iki katından fazla. Kimi K3 bir puan daha yüksekken 0,86 dolara, GLM-5.2 ise 0,57 dolara mal oluyor. Önceki modele kıyasla Qwen3.8 Max, AA-LCR (-2 puan) ve AA-Omniscience (-10 puan) testlerinde de gerileme gösteriyor. İsabet oranı yaklaşık %31'de kalırken, halüsinasyon oranı %23'ten %40'a yükseliyor; bu da Qwen3.8 Max'in pas geçmek yerine daha sık tahmin yürüttüğü anlamına geliyor.
Kaynak: The Decoder (DE) — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler