알리바바, Qwen2.5-Coder 출시: 최대 320억 파라미터, 오픈소스 코드 모델
Alibaba/Qwen
DeepSeek
Mistral
알리바바의 Qwen 팀이 Qwen2.5-Coder를 발표했습니다. 이는 차세대 오픈소스 코드 모델 시리즈로, 15억, 70억, 그리고 곧 출시될 320억 파라미터 크기로 제공되며, 5.5조 토큰으로 학습되었습니다. 70억 버전은 코드 작업에서 DeepSeek-Coder-V2-Lite 및 CodeStral-22B와 같은 더 큰 모델을 능가하는 성능을 보여주며, 강력한 수학 및 일반 능력도 유지합니다.
알리바바의 Qwen 팀이 Qwen2.5 시리즈의 일부로 CodeQwen1.5의 후속 모델인 Qwen2.5-Coder를 출시했습니다. 모델은 1.5B, 7B, 그리고 곧 출시될 32B 등 세 가지 크기로 제공됩니다. 5.5조 개의 토큰으로 훈련되었으며, 여기에는 소스 코드, 텍스트-코드 접지 데이터, 합성 데이터가 포함되고, 비코딩 능력을 유지하기 위해 추가 수학 및 일반 데이터도 포함됩니다. 기본 모델은 최대 128K 토큰 컨텍스트, 92개 프로그래밍 언어를 지원하며, 코드 생성, 완성, 수리 및 다국어 벤치마크에서 최첨단 성능을 달성합니다. 7B 버전은 코드 작업에서 DeepSeek-Coder-V2-Lite 및 CodeStral-22B를 능가하며, GSM8K 및 Math 평가에서도 경쟁력 있는 수학 성능을 보여줍니다. 명령어 튜닝 변종인 Qwen2.5-Coder-Instruct는 작업 성능과 일반화를 더욱 향상시켜 다국어 코드 추론(McEval), 코드 추론(CRUXEval), 수학 추론(GSM8K, OlympiadBench)에서 뛰어납니다. 또한 MMLU, CEval 및 기타 벤치마크에서 강력한 일반 능력을 유지합니다. 모델은 Apache 2.0 라이선스로 출시됩니다. 다음 단계로 32B 버전과 코드 중심 추론 모델 탐색이 계획되어 있습니다.
출처: Alibaba Qwen —
원문
