Z.ai发布GLM-5.3而无需重新训练基础模型:在复杂编码和长期任务上表现更佳
Anthropic
OpenAI
xAI
Z.ai已发布GLM-5.3,它运行在与GLM-5.2相同的743B基础模型上。所有改进均来自扩展的后训练,编码基准如Terminal-Bench 3.0从4.6跃升至28.3,网络安全评分在CyberGym上达到84.5%。权重尚未公开,但模型已通过API和编码计划上线,权重预计约两周后发布。
Z.ai发布了GLM-5.3,该模型与GLM-5.2基于同一743B基础模型,所有报告的改进均来自扩展的后训练,涉及更多任务环境、更多环境类型和更长的训练。该模型在长周期编码基准测试中表现出显著进步,Terminal-Bench 3.0从4.6提升至28.3,DeepSWE v1.1从46.2提升至66.9,Agents' Last Exam(命令行)从23.8提升至28.5。在内部Z.ai Code Bench上,公司报告相比于GLM-5.2提升了50%,在每任务约50,000个输出令牌的情况下得分31.4%,而Claude Opus 4.8在120,000个令牌时得分为29.5%,不过Claude Fable 5仍以39.5%领先。在网络安全方面,Z.ai将这些提升描述为计划外,CyberGym从77.2%升至84.5%,超过了Mythos 5的83.8%和GPT-5.6 Sol的83.6%,ExploitBench则从24.4%翻倍至54.4%,但仍落后于Mythos 5的78.0%。该模型可通过Z.ai API、GLM编程计划和ZCode获取,但权重尚未公开。Z.ai表示将在发布约两周后,在完成安全评估和加固后公开权重,并强调在利用链上越靠后的基准测试,相对于GLM-5.2的提升越大。
来源: MarkTechPost —
原文
