Z.ai Mengirim GLM-5.3 Tanpa Melatih Ulang Model Dasar: Lebih Baik dalam Coding Kompleks dan Tugas Jangka Panjang
Anthropic
OpenAI
xAI
Z.ai telah merilis GLM-5.3, yang berjalan pada model dasar 743B yang sama dengan GLM-5.2. Semua peningkatan berasal dari pasca-pelatihan yang diskalakan, dengan benchmark coding seperti Terminal-Bench 3.0 melonjak dari 4.6 menjadi 28.3 dan skor keamanan siber mencapai 84,5% pada CyberGym. Bobot belum dipublikasikan, tetapi model ini tersedia langsung melalui API dan Coding Plan, dengan bobot diperkirakan dalam sekitar dua minggu.
Z.ai merilis GLM-5.3, yang berjalan pada model dasar 743B yang sama dengan GLM-5.2, dengan semua peningkatan yang dilaporkan berasal dari pasca-pelatihan berskala besar yang melibatkan lebih banyak lingkungan tugas, lebih banyak jenis lingkungan, dan pelatihan yang lebih lama. Model ini menunjukkan peningkatan signifikan pada tolok ukur pengkodean jangka panjang, dengan Terminal-Bench 3.0 meningkat dari 4,6 menjadi 28,3, DeepSWE v1.1 dari 46,2 menjadi 66,9, dan Ujian Terakhir Agen (CLI) dari 23,8 menjadi 28,5. Pada Tolok Ukur Kode Z.ai internal, perusahaan melaporkan peningkatan 50% dibandingkan GLM-5.2, mencetak 31,4% pada sekitar 50.000 token keluaran per tugas, dibandingkan dengan Claude Opus 4.8 yang mencapai 29,5% pada 120.000 token, sementara Claude Fable 5 masih memimpin dengan 39,5%. Dalam keamanan siber, Z.ai menggambarkan peningkatan tersebut sebagai sesuatu yang tidak direncanakan, dengan CyberGym naik dari 77,2% menjadi 84,5%, melampaui Mythos 5 pada 83,8% dan GPT-5.6 Sol pada 83,6%, dan ExploitBench meningkat lebih dari dua kali lipat dari 24,4% menjadi 54,4%, meskipun masih tertinggal dari Mythos 5 pada 78,0%. Model ini tersedia melalui API Z.ai, Paket Pengkodean GLM, dan ZCode, tetapi bobotnya belum dipublikasikan. Z.ai menyatakan akan menerbitkan bobot sekitar dua minggu setelah peluncuran, setelah evaluasi keamanan dan penguatan selesai, dan menyoroti bahwa semakin dalam tolok ukur dalam rantai eksploitasi, semakin besar peningkatan dibandingkan GLM-5.2.
Sumber: MarkTechPost —
asli
