Mô hìnhAn toàn AI 🇺🇸 14.08.2026 13:02

Z.ai phát hành GLM-5.3 mà không huấn luyện lại mô hình gốc: Tốt hơn trong các tác vụ mã hóa phức tạp và tác vụ dài hạn

AnthropicAnthropic OpenAIOpenAI xAIxAI
Z.ai đã phát hành GLM-5.3, chạy trên cùng mô hình gốc 743B như GLM-5.2. Tất cả cải tiến đến từ việc mở rộng huấn luyện sau huấn luyện, với các benchmark mã hóa như Terminal-Bench 3.0 tăng từ 4,6 lên 28,3 và điểm an ninh mạng đạt 84,5% trên CyberGym. Trọng số chưa được công khai, nhưng mô hình có sẵn thông qua API và Gói lập trình, trọng số dự kiến sẽ được phát hành trong khoảng hai tuần.
Z.ai đã phát hành GLM-5.3, phiên bản chạy trên cùng cơ sở mô hình 743B như GLM-5.2, với tất cả các cải tiến được báo cáo đến từ việc huấn luyện sau mô hình được mở rộng, bao gồm nhiều môi trường nhiệm vụ hơn, nhiều loại môi trường hơn và thời gian huấn luyện dài hơn. Mô hình cho thấy sự cải thiện đáng kể trong các bài kiểm tra lập trình dài hạn, với Terminal-Bench 3.0 tăng từ 4.6 lên 28.3, DeepSWE v1.1 từ 46.2 lên 66.9 và Agents’ Last Exam (CLI) từ 23.8 lên 28.5. Trên Bảng xếp hạng mã nội bộ Z.ai, công ty báo cáo mức cải thiện 50% so với GLM-5.2, đạt điểm 31,4% với khoảng 50.000 token đầu ra cho mỗi nhiệm vụ, so với mức 29,5% của Claude Opus 4.8 với 120.000 token, trong khi Claude Fable 5 vẫn dẫn đầu với 39,5%. Trong lĩnh vực an ninh mạng, Z.ai mô tả những cải tiến này là không theo kế hoạch, với CyberGym tăng từ 77,2% lên 84,5%, vượt qua Mythos 5 ở mức 83,8% và GPT-5.6 Sol ở mức 83,6%, còn ExploitBench tăng hơn gấp đôi từ 24,4% lên 54,4%, dù vẫn thua Mythos 5 ở mức 78,0%. Mô hình có sẵn thông qua Z.ai API, GLM Coding Plan và ZCode, nhưng các trọng số của mô hình chưa được công khai. Z.ai cho biết sẽ công bố các trọng số sau khoảng hai tuần kể từ khi ra mắt, sau khi hoàn thành đánh giá và củng cố an toàn, đồng thời nhấn mạnh rằng bài kiểm tra càng sâu trong chuỗi khai thác, mức cải thiện so với GLM-5.2 càng lớn.
Nguồn: MarkTechPost — bản gốc
Bài viết liên quan trước đây ↓
Tin mới