Qwen2.5-Max: Büyük Ölçekli Bir MoE Modelinin Yeteneklerini Keşfetmek
Alibaba/Qwen
Alibaba Qwen, uzmanların karışımı (Mixture-of-Experts - MoE) mimarisine dayalı, 20 trilyondan fazla token ile eğitilmiş büyük bir dil modeli olan Qwen2.5-Max'i yayınladı. Model, birkaç kıyaslamada DeepSeek V3'ü geride bırakıyor ve Alibaba Cloud API'leri ile Qwen Chat aracılığıyla kullanılabiliyor.
Qwen ekibi, Qwen2.5-Max adlı büyük dil modelini yayınladı. Bu model, Uzman Karışımı (MoE) mimarisine dayanıyor ve 20 trilyon token üzerinde ön eğitimden geçirildi. Ön eğitimin ardından denetimli ince ayar (SFT) ve insan geri bildiriminden pekiştirmeli öğrenme (RLHF) uygulandı. Model, MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard ve GPQA-Diamond kıyaslamalarında DeepSeek V3, GPT-4o ve Claude-3.5-Sonnet ile karşılaştırıldı. Qwen2.5-Max, Arena-Hard, LiveBench, LiveCodeBench ve GPQA-Diamond'da DeepSeek V3'ü geride bırakırken, MMLU-Pro'da rekabetçi sonuçlar gösterdi. Temel modeller için DeepSeek V3, Llama-3.1-405B ve Qwen2.5-72B ile karşılaştırma yapıldı - Qwen2.5-Max çoğu testte önemli avantajlar sergiledi. Model, Qwen Chat ve Alibaba Cloud API'si (model adı: qwen-max-2025-01-25) üzerinden kullanıma sunuldu. API, OpenAI API'si ile uyumludur.
Kaynak: Alibaba Qwen —
orijinal
