ModellenAI-veiligheid 🇺🇸 14.08.2026 13:02

Z.ai brengt GLM-5.3 uit zonder het basismodel opnieuw te trainen: beter in complex coderen en langdurige taken

AnthropicAnthropic OpenAIOpenAI xAIxAI
Z.ai heeft GLM-5.3 uitgebracht, dat draait op hetzelfde 743B-basismodel als GLM-5.2. Alle verbeteringen komen voort uit opgeschaalde post-training. Codeerbenchmarks zoals Terminal-Bench 3.0 stegen van 4,6 naar 28,3 en cybersecurityscores bereikten 84,5% op CyberGym. De gewichten zijn nog niet openbaar, maar het model is live via API en Coding Plan; de gewichten worden over ongeveer twee weken verwacht.
Z.ai heeft GLM-5.3 uitgebracht, dat draait op hetzelfde 743B-basismodel als GLM-5.2, waarbij alle gerapporteerde verbeteringen voortkomen uit geschaalde post-training met meer taakomgevingen, meer omgevingstypen en langere training. Het model laat aanzienlijke winsten zien op benchmarks voor langetermijncodering, waarbij Terminal-Bench 3.0 verbetert van 4,6 naar 28,3, DeepSWE v1.1 van 46,2 naar 66,9, en Agents' Last Exam (CLI) van 23,8 naar 28,5. Op de interne Z.ai Code Bench rapporteert het bedrijf een verbetering van 50% ten opzichte van GLM-5.2, met een score van 31,4% bij ongeveer 50.000 outputtokens per taak, vergeleken met Claude Opus 4.8's 29,5% bij 120.000 tokens, terwijl Claude Fable 5 nog steeds leidt met 39,5%. Op het gebied van cybersecurity beschrijft Z.ai de winsten als ongepland, met CyberGym die stijgt van 77,2% naar 84,5%, waarmee Mythos 5 (83,8%) en GPT-5.6 Sol (83,6%) worden overtroffen, en ExploitBench die meer dan verdubbelt van 24,4% naar 54,4%, hoewel het nog steeds achterblijft bij Mythos 5 op 78,0%. Het model is beschikbaar via de Z.ai API, het GLM Coding Plan en ZCode, maar de gewichten zijn nog niet openbaar. Z.ai zegt dat het de gewichten ongeveer twee weken na de lancering zal publiceren, zodra de veiligheidsevaluatie en -hardening zijn afgerond, en benadrukt dat hoe dieper in de exploitatieketen een benchmark zit, hoe groter de winst ten opzichte van GLM-5.2 is.
Bron: MarkTechPost — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws