Z.ai liefert GLM-5.3 ohne Umtrainieren des Grundmodells: Besser bei komplexem Code und langfristigen Aufgaben
Anthropic
OpenAI
xAI
Z.ai hat GLM-5.3 veröffentlicht, das auf demselben 743B-Basismodell wie GLM-5.2 läuft. Alle Verbesserungen stammen aus skaliertem Post-Training, wobei Programmier-Benchmarks wie Terminal-Bench 3.0 von 4.6 auf 28.3 stiegen und Cybersicherheitswerte von 84,5% auf CyberGym erreicht wurden. Die Gewichte sind noch nicht öffentlich, aber das Modell ist über API und Coding Plan live, mit Gewichten voraussichtlich in etwa zwei Wochen.
Z.ai hat GLM-5.3 veröffentlicht, das auf demselben 743B-Basismodell wie GLM-5.2 basiert. Alle gemeldeten Verbesserungen stammen aus einem skalierten Post-Training mit mehr Aufgabenumgebungen, mehr Umgebungstypen und längerem Training. Das Modell zeigt deutliche Zuwächse bei Langzeit-Coding-Benchmarks: Terminal-Bench 3.0 verbesserte sich von 4,6 auf 28,3, DeepSWE v1.1 von 46,2 auf 66,9 und Agents‘ Last Exam (CLI) von 23,8 auf 28,5. Im internen Z.ai Code Bench berichtet das Unternehmen über eine 50-prozentige Verbesserung gegenüber GLM-5.2 mit einer Punktzahl von 31,4 Prozent bei etwa 50.000 Ausgabe-Token pro Aufgabe, verglichen mit Claude Opus 4.8 mit 29,5 Prozent bei 120.000 Token, während Claude Fable 5 mit 39,5 Prozent weiterhin führt. Im Bereich Cybersicherheit beschreibt Z.ai die Zuwächse als ungeplant: CyberGym stieg von 77,2 Prozent auf 84,5 Prozent und übertraf damit Mythos 5 mit 83,8 Prozent und GPT-5.6 Sol mit 83,6 Prozent; ExploitBench hat sich von 24,4 Prozent auf 54,4 Prozent mehr als verdoppelt, liegt aber weiterhin hinter Mythos 5 mit 78,0 Prozent. Das Modell ist über die Z.ai API, den GLM Coding Plan und ZCode verfügbar, die Gewichte sind jedoch noch nicht öffentlich. Z.ai kündigt an, die Gewichte etwa zwei Wochen nach dem Start zu veröffentlichen, sobald Sicherheitsbewertung und Härtung abgeschlossen sind, und betont, dass die Zuwächse gegenüber GLM-5.2 umso größer sind, je weiter ein Benchmark in der Exploitation-Kette liegt.
Quelle: MarkTechPost —
Original
