Z.ai livre GLM-5.3 sans réentraîner le modèle de base : meilleur en codage complexe et tâches à long horizon
Anthropic
OpenAI
xAI
Z.ai a publié GLM-5.3, qui fonctionne sur le même modèle de base 743B que GLM-5.2. Tous les gains proviennent d'un post-entraînement à grande échelle, avec des benchmarks de codage comme Terminal-Bench 3.0 passant de 4,6 à 28,3 et des scores de cybersécurité atteignant 84,5 % sur CyberGym. Les poids ne sont pas encore publics, mais le modèle est disponible via l'API et le plan de codage, avec des poids attendus dans environ deux semaines.
Z.ai a publié GLM-5.3, qui fonctionne sur le même modèle de base de 743B que GLM-5.2, toutes les améliorations rapportées provenant d'un post-entraînement à grande échelle impliquant davantage d'environnements de tâches, plus de types d'environnements et un entraînement plus long. Le modèle montre des gains significatifs dans les benchmarks de codage à long horizon, avec Terminal-Bench 3.0 passant de 4,6 à 28,3, DeepSWE v1.1 de 46,2 à 66,9, et Agents' Last Exam (CLI) de 23,8 à 28,5. Sur le benchmark interne Z.ai Code Bench, la société rapporte une amélioration de 50% par rapport à GLM-5.2, avec un score de 31,4% pour environ 50 000 jetons de sortie par tâche, contre 29,5% pour Claude Opus 4.8 avec 120 000 jetons, tandis que Claude Fable 5 reste en tête avec 39,5%. En cybersécurité, Z.ai décrit les gains comme non planifiés, avec CyberGym passant de 77,2% à 84,5%, dépassant Mythos 5 à 83,8% et GPT-5.6 Sol à 83,6%, et ExploitBench doublant presque, passant de 24,4% à 54,4%, bien que toujours derrière Mythos 5 à 78,0%. Le modèle est disponible via l'API Z.ai, le plan de codage GLM et ZCode, mais les poids ne sont pas encore publics. Z.ai indique qu'il publiera les poids environ deux semaines après le lancement, une fois l'évaluation de sécurité et le durcissement terminés, et souligne que plus un benchmark se situe profondément dans la chaîne d'exploitation, plus le gain par rapport à GLM-5.2 est important.
Source: MarkTechPost —
original
