MallitTekoälyturvallisuus 🇺🇸 14.08.2026 13:02

Z.ai julkaisee GLM-5.3:n ilman perusmallin uudelleenkoulutusta: Parempi monimutkaisessa koodauksessa ja pitkäjänteisissä tehtävissä

AnthropicAnthropic OpenAIOpenAI xAIxAI
Z.ai on julkaissut GLM-5.3:n, joka toimii samalla 743B perusmallilla kuin GLM-5.2. Kaikki parannukset tulevat skaalatusta jälkikoulutuksesta, ja koodausvertailut kuten Terminal-Bench 3.0 nousivat 4.6:sta 28.3:een ja kyberturvallisuuspisteet saavuttivat 84.5% CyberGymissä. Painoja ei ole vielä julkistettu, mutta malli on saatavilla API:n ja Coding Planin kautta, ja painot ovat odotettavissa noin kahden viikon kuluttua.
Z.ai julkaisi GLM-5.3:n, joka toimii samalla 743B-pohjamallilla kuin GLM-5.2, ja kaikki raportoidut parannukset tulevat skaalatusta jälkikoulutuksesta, joka sisältää enemmän tehtäväympäristöjä, enemmän ympäristötyyppejä ja pidemmän koulutuksen. Malli osoittaa merkittäviä parannuksia pitkän aikavälin koodausvertailuissa: Terminal-Bench 3.0 parani 4,6:sta 28,3:een, DeepSWE v1.1 46,2:sta 66,9:ään ja Agents’ Last Exam (CLI) 23,8:sta 28,5:een. Sisäisessä Z.ai Code Bench -vertailussa yritys raportoi 50 prosentin parannuksen GLM-5.2:een verrattuna, saavuttaen 31,4 prosentin tuloksen noin 50 000:lla lähtömerkillä tehtävää kohti, kun taas Claude Opus 4.8 sai 29,5 prosenttia 120 000:lla merkillä, ja Claude Fable 5 johtaa edelleen 39,5 prosentilla. Kyberturvallisuudessa Z.ai kuvaa parannuksia suunnittelemattomiksi: CyberGym nousi 77,2 prosentista 84,5 prosenttiin, ohittaen Mythos 5:n (83,8 prosenttia) ja GPT-5.6 Solin (83,6 prosenttia), ja ExploitBench yli kaksinkertaistui 24,4 prosentista 54,4 prosenttiin, vaikka on edelleen jäljessä Mythos 5:stä (78,0 prosenttia). Malli on saatavilla Z.ai API:n, GLM Coding Planin ja ZCoden kautta, mutta painoja ei ole vielä julkaistu. Z.ai kertoo julkaisevansa painot noin kaksi viikkoa julkaisun jälkeen, kun turvallisuusarviointi ja -kovennus on saatu päätökseen, ja korostaa, että mitä syvemmällä vertailu on hyväksikäyttöketjussa, sitä suurempi parannus GLM-5.2:een verrattuna.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset