Z.ai, 기본 모델 재훈련 없이 GLM-5.3 출시: 복잡한 코딩 및 장기 과제에서 우수성
Anthropic
OpenAI
xAI
Z.ai는 GLM-5.2와 동일한 743B 기본 모델로 실행되는 GLM-5.3을 출시했습니다. 모든 개선은 확장된 사후 훈련에서 비롯되었으며, Terminal-Bench 3.0과 같은 코딩 벤치마크에서 4.6에서 28.3으로, 사이버 보안 점수는 CyberGym에서 84.5%에 도달했습니다. 가중치는 아직 공개되지 않았지만, 모델은 API와 코딩 플랜을 통해 제공되며, 가중치는 약 2주 후에 공개될 예정입니다.
Z.ai는 GLM-5.2와 동일한 743B 기본 모델을 기반으로 하는 GLM-5.3을 출시했으며, 보고된 모든 개선 사항은 더 많은 작업 환경, 더 많은 환경 유형, 더 긴 훈련을 포함하는 확장된 사후 훈련에서 비롯되었습니다. 이 모델은 장기 지평 코딩 벤치마크에서 상당한 향상을 보여주며, Terminal-Bench 3.0은 4.6에서 28.3으로, DeepSWE v1.1은 46.2에서 66.9로, Agents' Last Exam(CLI)은 23.8에서 28.5로 개선되었습니다. 내부 Z.ai Code Bench에서 회사는 GLM-5.2 대비 50% 향상된 31.4%의 점수를 보고했으며, 작업당 약 50,000 출력 토큰에서 측정된 반면, Claude Opus 4.8은 120,000 토큰에서 29.5%를 기록했고, Claude Fable 5는 여전히 39.5%로 선두를 유지하고 있습니다. 사이버 보안 분야에서 Z.ai는 이러한 향상이 계획되지 않은 것이라고 설명하며, CyberGym은 77.2%에서 84.5%로 상승하여 Mythos 5(83.8%)와 GPT-5.6 Sol(83.6%)을 능가했고, ExploitBench는 24.4%에서 54.4%로 두 배 이상 증가했지만 여전히 Mythos 5(78.0%)에는 미치지 못합니다. 이 모델은 Z.ai API, GLM Coding Plan 및 ZCode를 통해 사용할 수 있지만, 가중치는 아직 공개되지 않았습니다. Z.ai는 출시 후 약 2주 후에 안전 평가와 강화가 완료되면 가중치를 공개할 것이라고 밝히며, 벤치마크가 공격 체인의 깊은 부분일수록 GLM-5.2 대비 이득이 더 크다고 강조했습니다.
출처: MarkTechPost —
원문
