Qwen2.5-Max: Khám phá khả năng của mô hình MoE quy mô lớn
Alibaba/Qwen
Alibaba Qwen đã phát hành Qwen2.5-Max, một mô hình ngôn ngữ lớn dựa trên kiến trúc Mixture-of-Experts, được huấn luyện trên hơn 20 nghìn tỷ token. Mô hình này vượt trội hơn DeepSeek V3 trên một số điểm chuẩn và có sẵn thông qua API của Alibaba Cloud và Qwen Chat.
Nhóm Qwen đã phát hành Qwen2.5-Max, một mô hình ngôn ngữ lớn dựa trên kiến trúc Mixture-of-Experts (MoE), được tiền huấn luyện trên hơn 20 nghìn tỷ token. Sau tiền huấn luyện, các bước tinh chỉnh có giám sát (SFT) và học tăng cường từ phản hồi của con người (RLHF) đã được áp dụng. Mô hình được so sánh với DeepSeek V3, GPT-4o và Claude-3.5-Sonnet trên các điểm chuẩn MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard và GPQA-Diamond. Qwen2.5-Max vượt trội hơn DeepSeek V3 trong Arena-Hard, LiveBench, LiveCodeBench và GPQA-Diamond, đồng thời cho kết quả cạnh tranh ở MMLU-Pro. Đối với các mô hình nền tảng, so sánh được thực hiện với DeepSeek V3, Llama-3.1-405B và Qwen2.5-72B — Qwen2.5-Max cho thấy lợi thế đáng kể trong hầu hết các bài kiểm tra. Mô hình có sẵn trong Qwen Chat và thông qua API của Alibaba Cloud (tên mô hình: qwen-max-2025-01-25). API tương thích với API của OpenAI.
Nguồn: Alibaba Qwen —
bản gốc
