ModelosSegurança de IA 🇺🇸 14.08.2026 13:02

Z.ai lança GLM-5.3 sem re-treinar o modelo base: melhor em codificação complexa e tarefas de longo horizonte

AnthropicAnthropic OpenAIOpenAI xAIxAI
A Z.ai lançou o GLM-5.3, que roda no mesmo modelo base de 743B do GLM-5.2. Todos os ganhos vêm do pós-treinamento em escala, com benchmarks de codificação como Terminal-Bench 3.0 saltando de 4,6 para 28,3 e pontuações de segurança cibernética alcançando 84,5% no CyberGym. Os pesos ainda não são públicos, mas o modelo está disponível via API e Plano de Codificação, com pesos esperados em cerca de duas semanas.
A Z.ai lançou o GLM-5.3, que roda no mesmo modelo base de 743B que o GLM-5.2, com todas as melhorias relatadas provenientes de pós-treinamento em escala envolvendo mais ambientes de tarefa, mais tipos de ambiente e treinamento mais longo. O modelo mostra ganhos significativos em benchmarks de codificação de horizonte longo, com o Terminal-Bench 3.0 melhorando de 4,6 para 28,3, o DeepSWE v1.1 de 46,2 para 66,9 e o Agents' Last Exam (CLI) de 23,8 para 28,5. No benchmark interno Z.ai Code Bench, a empresa relata uma melhoria de 50% em relação ao GLM-5.2, marcando 31,4% com aproximadamente 50.000 tokens de saída por tarefa, em comparação com os 29,5% do Claude Opus 4.8 com 120.000 tokens, enquanto o Claude Fable 5 ainda lidera com 39,5%. Em segurança cibernética, a Z.ai descreve os ganhos como não planejados, com o CyberGym passando de 77,2% para 84,5%, superando o Mythos 5 com 83,8% e o GPT-5.6 Sol com 83,6%, e o ExploitBench mais que dobrando de 24,4% para 54,4%, embora ainda fique atrás do Mythos 5 com 78,0%. O modelo está disponível via API da Z.ai, no GLM Coding Plan e no ZCode, mas os pesos ainda não são públicos. A Z.ai afirma que publicará os pesos aproximadamente duas semanas após o lançamento, assim que a avaliação de segurança e o endurecimento forem concluídos, e destaca que quanto mais profundo na cadeia de exploração um benchmark se encontra, maior é o ganho em relação ao GLM-5.2.
Fonte: MarkTechPost — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas