Fable. GLM 5.2 почти догоняет Opus 4.8 в некоторых агентных бенчмарках кодинга, таких как FrontierSWE и PostTrainBench, а также показывает хорошие результаты в кибербезопасности, что вызвало сравнения с Mythos от Anthropic. Однако собственный отчёт Z.ai фиксирует победу GLM 5.2 лишь в двух менее сложных бенчмарках рассуждений, а в агентном кодинге модель уступает Opus 4.8: в SWE-Marathon GLM 5.2 выполнила 13% задач против 26% у Opus 4.8. Разработчики отмечают, что модель хорошо справляется с длительными задачами и веб-дизайном — Хасан назвал её «очень хорошим вкусом» в веб-дизайне, а Дэвид Никс из MetaRouter использует её для 10–20% своих задач. В то же время Сай Киран Мьядарам из Indhic AI столкнулся с быстрым расходом квоты токенов и проблемами галлюцинаций и излишнего планирования, из-за чего вернулся к OpenAI Codex.