Z.ai, GLM-5.3'ü Temel Modeli Yeniden Eğitmeden Yayınladı: Karmaşık Kodlama ve Uzun Vadeli Görevlerde Daha İyi
Anthropic
OpenAI
xAI
Z.ai, GLM-5.2 ile aynı 743B temel model üzerinde çalışan GLM-5.3'ü yayınladı. Tüm kazanımlar ölçeklenmiş son eğitimden geliyor; Terminal-Bench 3.0 gibi kodlama kıyaslamaları 4,6'dan 28,3'e sıçrarken, CyberGym'de siber güvenlik puanları %84,5'e ulaşıyor. Ağırlıklar henüz halka açık değil, ancak model API ve Kodlama Planı üzerinden canlı; ağırlıkların yaklaşık iki hafta içinde yayınlanması bekleniyor.
Z.ai, GLM-5.3'ü yayınladı. Model, GLM-5.2 ile aynı 743B temel modeli üzerinde çalışıyor ve bildirilen tüm iyileştirmeler, daha fazla görev ortamı, daha fazla ortam türü ve daha uzun eğitim içeren ölçeklendirilmiş sonradan eğitimden (post-training) geliyor. Model, uzun vadeli kodlama kıyaslamalarında önemli kazanımlar gösteriyor: Terminal-Bench 3.0'da 4,6'dan 28,3'e, DeepSWE v1.1'de 46,2'den 66,9'a ve Agents' Last Exam (CLI) bölümünde 23,8'den 28,5'e yükseliş görülüyor. Şirket, dahili Z.ai Code Bench'te GLM-5.2'ye kıyasla %50'lik bir iyileşme bildiriyor ve görev başına yaklaşık 50.000 çıktı token'ı ile %31,4 puan alırken, Claude Opus 4.8'in 120.000 token ile %29,5 puan aldığını, Claude Fable 5'in ise %39,5 ile hâlâ lider olduğunu belirtiyor. Siber güvenlikte ise Z.ai kazanımları plansız olarak nitelendiriyor: CyberGym %77,2'den %84,5'e yükselerek %83,8 ile Mythos 5'i ve %83,6 ile GPT-5.6 Sol'u geride bırakırken, ExploitBench %24,4'ten %54,4'e iki katından fazla artış gösteriyor, ancak yine de %78,0 ile Mythos 5'in gerisinde kalıyor. Model, Z.ai API, GLM Coding Plan ve ZCode üzerinden kullanılabilir, ancak ağırlıklar henüz kamuya açık değil. Z.ai, güvenlik değerlendirmesi ve sertleştirme tamamlandıktan sonra, lansmandan yaklaşık iki hafta sonra ağırlıkları yayınlayacağını söylüyor ve bir kıyaslama sömürü zincirinde ne kadar derinse, GLM-5.2'ye kıyasla kazancın o kadar büyük olduğunu vurguluyor.
Kaynak: MarkTechPost —
orijinal
