Z.ai lanza GLM-5.3 sin reentrenar el modelo base: mejor en codificación compleja y tareas de largo alcance
Anthropic
OpenAI
xAI
Z.ai ha lanzado GLM-5.3, que se ejecuta en el mismo modelo base de 743.000 millones de parámetros que GLM-5.2. Todas las mejoras provienen de un post-entrenamiento a escala, con benchmarks de codificación como Terminal-Bench 3.0 subiendo de 4.6 a 28.3 y puntuaciones de ciberseguridad alcanzando el 84.5% en CyberGym. Los pesos aún no son públicos, pero el modelo está disponible a través de API y Plan de Codificación, con los pesos esperados en aproximadamente dos semanas.
Z.ai ha lanzado GLM-5.3, que se ejecuta sobre el mismo modelo base de 743B que GLM-5.2, con todas las mejoras reportadas provenientes de un post-entrenamiento a escala que involucra más entornos de tareas, más tipos de entornos y un entrenamiento más largo. El modelo muestra mejoras significativas en los benchmarks de codificación de largo horizonte, con Terminal-Bench 3.0 mejorando de 4.6 a 28.3, DeepSWE v1.1 de 46.2 a 66.9, y Agents' Last Exam (CLI) de 23.8 a 28.5. En el benchmark interno Z.ai Code Bench, la compañía reporta una mejora del 50% sobre GLM-5.2, obteniendo un 31.4% con aproximadamente 50,000 tokens de salida por tarea, en comparación con el 29.5% de Claude Opus 4.8 con 120,000 tokens, mientras que Claude Fable 5 sigue liderando con un 39.5%. En ciberseguridad, Z.ai describe las ganancias como no planificadas, con CyberGym pasando de 77.2% a 84.5%, superando a Mythos 5 con 83.8% y a GPT-5.6 Sol con 83.6%, y ExploitBench más que duplicándose de 24.4% a 54.4%, aunque todavía por detrás de Mythos 5 con 78.0%. El modelo está disponible a través de la API de Z.ai, el GLM Coding Plan y ZCode, pero los pesos aún no son públicos. Z.ai dice que publicará los pesos aproximadamente dos semanas después del lanzamiento, una vez que se complete la evaluación y el endurecimiento de seguridad, y destaca que cuanto más profundo en la cadena de explotación se sitúa un benchmark, mayor es la ganancia sobre GLM-5.2.
Fuente: MarkTechPost —
original
