Qwen2.5: Eine Party der Foundation-Modelle!
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
Alibabas Qwen-Team kündigt die Open-Source-Veröffentlichung von Qwen2.5 LLMs an, zusammen mit spezialisierten Modellen für Codierung (Qwen2.5-Coder) und Mathematik (Qwen2.5-Math). Die Modelle reichen von 0,5 bis 72 Milliarden Parametern, vortrainiert auf bis zu 18 Billionen Token, mit signifikanten Verbesserungen in Wissen, Codierung und mathematischen Fähigkeiten. Die Veröffentlichung umfasst auch die API-Modelle Qwen-Plus und Qwen-Turbo.
Das Alibaba-Team Qwen hat Qwen2.5 veröffentlicht, eine Familie von quelloffenen Decoder-Only-Sprachmodellen, sowie die spezialisierten Modelle Qwen2.5-Coder und Qwen2.5-Math. Die Modelle sind in Größen von 0,5B bis 72B Parametern erhältlich und wurden auf bis zu 18 Billionen Token vortrainiert. Qwen2.5 erreicht MMLU 85+, HumanEval 85+ und MATH 80+, unterstützt Kontexte von bis zu 128.000 Token und bis zu 8K Token Generierung und bietet mehrsprachige Unterstützung für über 29 Sprachen. Qwen2.5-Coder wurde mit 5,5 Billionen Token an Codedaten trainiert, während Qwen2.5-Math CoT, PoT und TIR Reasoning unterstützt. Die Flaggschiff-API-Modelle Qwen-Plus und Qwen-Turbo werden ebenfalls angeboten. Die 3B- und 72B-Varianten sind nicht unter der Apache-2.0-Lizenz lizenziert.
Quelle: Alibaba Qwen —
Original
