阿里巴巴发布Qwen2.5-Coder:最高320亿参数,开源代码模型
Alibaba/Qwen
DeepSeek
Mistral
阿里巴巴Qwen团队宣布推出Qwen2.5-Coder,这是新一代开源代码模型系列,包含1.5B、7B以及即将推出的32B参数规模,基于5.5万亿个token训练。7B版本在代码任务上超越了DeepSeek-Coder-V2-Lite和CodeStral-22B等更大模型,同时保留了强大的数学和通用能力。
阿里巴巴Qwen团队发布了Qwen2.5-Coder,这是CodeQwen1.5的继任者,属于Qwen2.5系列的一部分。该模型提供三种规模:1.5B、7B版本,以及即将推出的32B版本。它们在5.5万亿个token上进行了训练,包括源代码、文本与代码对齐数据以及合成数据,并额外加入了数学和通用数据以保持非编码能力。基础模型支持高达128K token的上下文、92种编程语言,并在代码生成、补全、修复和多语言基准测试中取得了领先结果。7B版本在代码任务上优于DeepSeek-Coder-V2-Lite和CodeStral-22B,同时在GSM8K和数学评估中表现出有竞争力的数学性能。指令微调变体Qwen2.5-Coder-Instruct进一步提升了任务性能和泛化能力,在多语言代码推理(McEval)、代码推理(CRUXEval)和数学推理(GSM8K、OlympiadBench)方面表现出色。它还在MMLU、CEval等基准测试中保持了强大的通用能力。这些模型根据Apache 2.0许可证发布。下一步计划包括推出32B版本以及探索以代码为核心的推理模型。
来源: Alibaba Qwen —
原文
