Alibaba phát hành Qwen2.5-Coder: Lên đến 32B tham số, mô hình mã nguồn mở
Alibaba/Qwen
DeepSeek
Mistral
Nhóm Qwen của Alibaba công bố Qwen2.5-Coder, dòng mô hình mã nguồn mở thế hệ tiếp theo với các phiên bản 1,5B, 7B và sắp tới là 32B tham số, được huấn luyện trên 5,5 nghìn tỷ token. Phiên bản 7B vượt qua các mô hình lớn hơn như DeepSeek-Coder-V2-Lite và CodeStral-22B trong các tác vụ lập trình, đồng thời vẫn giữ khả năng toán học và tổng quát mạnh mẽ.
Alibaba đã cho ra mắt Qwen2.5-Coder, phiên bản kế nhiệm của CodeQwen1.5, thuộc dòng sản phẩm Qwen2.5. Các mô hình có ba kích thước: 1,5 tỷ tham số, 7 tỷ tham số và phiên bản 32 tỷ tham số sắp ra mắt. Chúng được huấn luyện trên 5,5 nghìn tỷ token, bao gồm mã nguồn, dữ liệu kết nối văn bản-mã và dữ liệu tổng hợp, cùng với dữ liệu toán học và dữ liệu tổng quát bổ sung để duy trì khả năng không liên quan đến lập trình. Mô hình cơ sở hỗ trợ ngữ cảnh lên đến 128 nghìn token, 92 ngôn ngữ lập trình và đạt kết quả tốt nhất trên các chuẩn mực về sinh mã, hoàn thiện mã, sửa mã và đa ngôn ngữ. Phiên bản 7 tỷ tham số vượt trội so với DeepSeek-Coder-V2-Lite và CodeStral-22B trong các tác vụ lập trình, đồng thời cũng cho thấy hiệu suất toán học cạnh tranh trên các bài đánh giá GSM8K và Math. Biến thể được tinh chỉnh hướng dẫn, Qwen2.5-Coder-Instruct, cải thiện hơn nữa hiệu suất tác vụ và khả năng khái quát hóa, xuất sắc trong suy luận mã đa ngôn ngữ (McEval), suy luận mã (CRUXEval) và suy luận toán học (GSM8K, OlympiadBench). Nó cũng duy trì khả năng tổng quát mạnh mẽ trên MMLU, CEval và các chuẩn mực khác. Các mô hình được phát hành theo giấy phép Apache 2.0. Các bước tiếp theo bao gồm phiên bản 32 tỷ tham số và khám phá các mô hình suy luận lấy lập trình làm trung tâm.
Nguồn: Alibaba Qwen —
bản gốc
