3.0 улучшился с 4,6 до 28,3, DeepSWE v1.1 — с 46,2 до 66,9, а Agents’ Last Exam (CLI) — с 23,8 до 28,5. В рамках внутреннего бенчмарка Z.ai Code Bench компания сообщает о 50-процентном улучшении по сравнению с GLM-5.2: показатель составил 31,4% при примерно 50 тысяч выходных токенов на задачу, в то время как у Claude Opus 4.8 он равен 29,5% при 120 тысячах токенов. При этом лидером остается Claude Fable 5 с результатом 39,5%. В кибербезопасности Z.ai называет полученные улучшения незапланированными: результат в CyberGym вырос с 77,2% до 84,5%, что позволило обогнать Mythos 5 (83,8%) и GPT-5.6 Sol (83,6%). В ExploitBench показатель увеличился более чем в два раза — с 24,4% до 54,4%, though still trailing Mythos 5 at 78.0%. The model is available via the Z.ai API, the GLM Coding Plan, and ZCode, but weights are not yet public. Z.ai says it will publish weights roughly two weeks after launch, once safety evaluation and hardening finish, and highlights that the deeper into the exploitation chain a benchmark sits, the larger the gain over GLM-5.2.