Qwen2.5: Een partij aan basismodellen!
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
Alibaba's Qwen-team kondigt de open-source release aan van Qwen2.5 LLM's, samen met gespecialiseerde modellen voor coderen (Qwen2.5-Coder) en wiskunde (Qwen2.5-Math). De modellen variëren van 0,5B tot 72B parameters, getraind op maximaal 18 biljoen tokens, met aanzienlijke verbeteringen in kennis, coderen en wiskundige vaardigheden. De release bevat ook API-modellen Qwen-Plus en Qwen-Turbo.
Het Qwen-team van Alibaba heeft Qwen2.5 uitgebracht, een familie van open-source decoder-only taalmodellen, samen met de gespecialiseerde modellen Qwen2.5-Coder en Qwen2.5-Math. De modellen zijn beschikbaar in groottes van 0,5B tot 72B parameters, getraind op maximaal 18 biljoen tokens. Qwen2.5 behaalt MMLU 85+, HumanEval 85+ en MATH 80+, ondersteunt contexten tot 128K tokens en generatie van 8K, en biedt meertalige ondersteuning voor meer dan 29 talen. Qwen2.5-Coder is getraind op 5,5 biljoen tokens aan code-data, terwijl Qwen2.5-Math redeneringen in Chain of Thought (CoT), Program of Thought (PoT) en Tool-integrated Reasoning (TIR) ondersteunt. Ook worden de vlaggenschip-API-modellen Qwen-Plus en Qwen-Turbo aangeboden. De varianten van 3B en 72B vallen niet onder de Apache 2.0-licentie.
Bron: Alibaba Qwen —
origineel
