ModellenOpen Source 🇨🇳 28.07.2026 18:03

Alibaba brengt Qwen2.5-Coder uit: tot 32B parameters, open-source codemodellen

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek MistralMistral
Het Qwen-team van Alibaba kondigt Qwen2.5-Coder aan, een volgende generatie open-source codemodellenserie in formaten 1,5B, 7B en binnenkort 32B, getraind op 5,5 biljoen tokens. De 7B-versie overtreft grotere modellen zoals DeepSeek-Coder-V2-Lite en CodeStral-22B bij codetaken, terwijl het sterke wiskunde- en algemene vaardigheden behoudt.
Het Qwen-team van Alibaba heeft Qwen2.5-Coder uitgebracht, de opvolger van CodeQwen1.5, als onderdeel van de Qwen2.5-serie. De modellen zijn beschikbaar in drie formaten: 1,5B, 7B en een 32B-versie die binnenkort verschijnt. Ze zijn getraind op 5,5 biljoen tokens, waaronder broncode, tekst-code-verankerde gegevens en synthetische data, met extra wiskunde- en algemene gegevens om niet-codeer-vaardigheden te behouden. Het basismodel ondersteunt tot 128K tokens context, 92 programmeertalen en behaalt state-of-the-art resultaten op het gebied van codegeneratie, -completie, -reparatie en meertalige benchmarks. De 7B-versie presteert beter dan DeepSeek-Coder-V2-Lite en CodeStral-22B op codeertaken, en toont ook concurrerende wiskundige prestaties op GSM8K- en Math-evaluaties. De instructie-afgestemde variant, Qwen2.5-Coder-Instruct, verbetert de taakprestaties en generalisatie verder, met uitstekende prestaties op meertalige code-redenering (McEval), code-redenering (CRUXEval) en wiskundig redeneren (GSM8K, OlympiadBench). Het behoudt ook sterke algemene vaardigheden op MMLU, CEval en andere benchmarks. De modellen worden uitgebracht onder de Apache 2.0-licentie. Volgende stappen zijn een 32B-versie en verkenning van codegerichte redeneermodellen.
Bron: Alibaba Qwen — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws