Qwen2.5: 기초 모델들의 향연!
Alibaba/Qwen
Meta
Mistral
OpenAI
Anthropic
DeepSeek
Microsoft
Google/DeepMind
알리바바의 Qwen 팀이 Qwen2.5 LLM의 오픈소스 공개와 함께 코딩(Qwen2.5-Coder) 및 수학(Qwen2.5-Math) 특화 모델을 발표했습니다. 모델은 0.5B에서 72B 파라미터까지 다양하며, 최대 18조 토큰으로 사전 학습되어 지식, 코딩 및 수학 능력에서 상당한 개선을 이루었습니다. 이번 릴리스에는 API 모델인 Qwen-Plus와 Qwen-Turbo도 포함됩니다.
알리바바의 Qwen 팀이 오픈소스 디코더 전용 언어 모델군인 Qwen2.5를 출시했으며, 특화 모델인 Qwen2.5-Coder와 Qwen2.5-Math도 함께 공개했습니다. 이 모델들은 0.5B에서 72B 파라미터까지 다양한 크기로 제공되며, 최대 18조 토큰으로 사전 학습되었습니다. Qwen2.5는 MMLU 85+, HumanEval 85+, MATH 80+의 성능을 달성했으며, 최대 128K 토큰의 컨텍스트와 8K 생성 길이를 지원하고, 29개 이상의 언어에 대한 다국어 지원을 제공합니다. Qwen2.5-Coder는 5.5조 토큰의 코드 데이터로 학습되었고, Qwen2.5-Math는 CoT (Chain-of-Thought), PoT (Program-of-Thought), TIR (Tool-Integrated Reasoning) 추론을 지원합니다. 또한 플래그십 API 모델인 Qwen-Plus와 Qwen-Turbo도 제공됩니다. 3B와 72B 변종은 Apache 2.0 라이선스가 적용되지 않습니다.
출처: Alibaba Qwen —
원문
