النماذجالأعمال والسوق 🇩🇪 06.08.2026 16:01

Qwen3.8 Max: أقوى نموذج من Alibaba يخمّن أكثر ويكلف أكثر لكل مهمة

Alibaba/QwenAlibaba/Qwen AnthropicAnthropic Moonshot AIMoonshot AI
يحقق نموذج Qwen3.8 Max من Alibaba 56 نقطة في مؤشر الذكاء الخاص بـ Artificial Analysis، أي بزيادة 10 نقاط عن Qwen3.7 Max، معادلاً بذلك نموذج Claude Opus 4.8. ومع ذلك، فهو أكثر تكلفة لكل مهمة (1.14 دولار مقابل 0.53 دولار) ويُظهر معدلات هلوسة متزايدة (40% مقابل 23%) في اختبار AA-Omniscience.
أحرز نموذج Qwen3.8 Max من علي بابا درجة 56 في مؤشر الذكاء الاصطناعي التحليلي، بزيادة 10 نقاط عن Qwen3.7 Max (46). وفقًا لـ Artificial Analysis، فإنه يعادل Claude Opus 4.8، ويتقدم على GLM-5.2 (51)، لكنه يتخلف عن Kimi K3 (57)، الذي يعمل أيضًا بتكلفة أقل بنسبة 25%. في معيار العمل GDPval-AA، يقفز Qwen بمقدار 468 نقطة إيلو ليصل إلى 1739، متجاوزًا Kimi K3 (1685)، مع تفوق Claude Opus 5 فقط (1852). يتطلب Qwen3.8 Max 64 خطوة عمل لكل مهمة بدلاً من 14، وزادت رموز الإدخال 15 ضعفًا لأن الاختبار يعيد إرسال سجل المحادثة بالكامل في كل خطوة. النموذج أكثر شمولاً لكنه أبطأ وأكثر تكلفة. على الرغم من انخفاض أسعار الرموز (الإدخال 2 دولار مقابل 2.50 دولار، والإخراج 6 دولارات مقابل 7.50 دولارات، وضرب ذاكرة التخزين المؤقت 0.25 دولار مقابل 0.50 دولار لكل مليون)، فإن المهمة الواحدة في مؤشر الذكاء تكلف 1.14 دولار، أي أكثر من ضعف تكلفة Qwen3.7 Max البالغة 0.53 دولار. تبلغ تكلفة Kimi K3 0.86 دولار مع نقطة إضافية، وGLM-5.2 0.57 دولار. مقارنة بسابقه، يتراجع Qwen3.8 Max أيضًا في AA-LCR (نقطتان أقل) وAA-Omniscience (10 نقاط أقل). يظل معدل الدقة حوالي 31%، لكن معدل الهلوسة يرتفع من 23% إلى 40%، مما يعني أن Qwen3.8 Max يخمن أكثر بدلاً من التمرير.
المصدر: The Decoder (DE) — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة