ModellerAçık Kaynak 🇨🇳 28.07.2026 18:03

Qwen2.5-LLM: Dil Modellerinin Sınırlarını Genişletmek

Alibaba/QwenAlibaba/Qwen
Alibaba'nın Qwen ekibi, 0,5 milyardan 72 milyara kadar parametreye sahip yedi açık kaynak model içeren Qwen2.5 serisi dil modellerini yayınladı. Modeller, daha büyük bir ön eğitim veri kümesi (18 trilyon tokena kadar), gelişmiş bilgi, kodlama ve matematik yetenekleri sunuyor ve 128 bin tokena kadar bağlam uzunluğunu destekliyor.
Alibaba'nın Qwen ekibi, yalnızca kod çözücü katmanına sahip yoğun modeller olan Qwen2.5 serisi dil modellerini duyurdu. Yedi model açık kaynak olarak yayınlandı: 0,5B, 1,5B, 3B, 7B, 14B, 32B ve 72B parametreli. Ön eğitim veri seti 7 trilyon token'den 18 trilyon token'e genişletildi. Qwen2 ile karşılaştırıldığında, Qwen2.5 MMLU, kodlama kıyaslamaları (LiveCodeBench, MultiPL-E, MBPP) ve matematik kıyaslamalarında (MATH) iyileştirmeler gösteriyor. Qwen2.5-72B, parametre sayısının beşte birini kullanarak birçok görevde Llama-3-405B'yi geride bırakıyor. Qwen-Plus ve Qwen-Turbo ek modelleri Alibaba Cloud Model Studio API'si aracılığıyla kullanılabiliyor. Qwen2.5-3B ve Qwen2.5-72B'nin ayrı lisansları olduğu için çoğu model Apache 2.0 lisansı altında sunuluyor.
Kaynak: Alibaba Qwen — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler