Z.ai تطلق GLM-5.3 دون إعادة تدريب النموذج الأساسي: أفضل في البرمجة المعقدة والمهام طويلة المدى
Anthropic
OpenAI
xAI
أصدرت Z.ai نموذج GLM-5.3، الذي يعمل على نفس النموذج الأساسي 743B مثل GLM-5.2. تأتي جميع التحسينات من التدريب اللاحق الموسع، حيث قفزت معايير البرمجة مثل Terminal-Bench 3.0 من 4.6 إلى 28.3 ووصلت نتائج الأمن السيبراني إلى 84.5% على CyberGym. الأوزان ليست متاحة للعموم بعد، لكن النموذج متاح عبر الواجهة البرمجية (API) وخطة البرمجة، ومن المتوقع أن تكون الأوزان متاحة خلال أسبوعين تقريبًا.
أصدرت Z.ai إصدار GLM-5.3، الذي يعمل على نفس النموذج الأساسي 743B مثل GLM-5.2، مع تحسينات جميعها ناتجة عن تدريب لاحق موسع يتضمن بيئات مهام أكثر، وأنواع بيئات أكثر، وتدريبًا أطول. يُظهر النموذج مكاسب كبيرة في معايير البرمجة طويلة الأمد، حيث تحسن أداء Terminal-Bench 3.0 من 4.6 إلى 28.3، وDeepSWE v1.1 من 46.2 إلى 66.9، واختبار Agents’ Last Exam (CLI) من 23.8 إلى 28.5. على معيار Z.ai Code Bench الداخلي، تذكر الشركة تحسنًا بنسبة 50% مقارنةً بـ GLM-5.2، محققًا 31.4% عند حوالي 50,000 رمز إخراج لكل مهمة، مقارنةً بـ Claude Opus 4.8 الذي حقق 29.5% عند 120,000 رمز، بينما لا يزال Claude Fable 5 يتصدر بنسبة 39.5%. في مجال الأمن السيبراني، تصف Z.ai المكاسب بأنها غير مخطط لها، حيث انتقل CyberGym من 77.2% إلى 84.5%، متجاوزًا Mythos 5 بنسبة 83.8% وGPT-5.6 Sol بنسبة 83.6%، وExploitBench تضاعف أكثر من الضعف من 24.4% إلى 54.4%، على الرغم من أنه لا يزال متخلفًا عن Mythos 5 بنسبة 78.0%. يتوفر النموذج عبر واجهة برمجة تطبيقات Z.ai، وخطة GLM Coding، وZCode، لكن الأوزان ليست عامة بعد. تقول Z.ai إنها ستنشر الأوزان بعد حوالي أسبوعين من الإطلاق، بمجرد الانتهاء من تقييم السلامة وتقويتها، وتسلط الضوء على أنه كلما كان المعيار أعمق في سلسلة الاستغلال، كلما كان المكسب أكبر مقارنةً بـ GLM-5.2.
المصدر: MarkTechPost —
الأصلي
