Qwen2.5-LLM: 언어 모델의 경계 확장
Alibaba/Qwen
알리바바의 Qwen 팀이 0.5B에서 72B 파라미터까지 7개의 오픈소스 모델로 구성된 Qwen2.5 시리즈 언어 모델을 출시했습니다. 이 모델들은 더 큰 사전 훈련 데이터셋(최대 18조 개의 토큰), 향상된 지식, 코딩, 수학 능력, 최대 128K 토큰의 컨텍스트 길이를 지원합니다.
알리바바의 큐원(Qwen) 팀이 디코더 전용 밀집 모델인 Qwen2.5 시리즈 언어 모델을 발표했습니다. 7개의 모델이 오픈소스로 공개되었으며, 매개변수는 각각 0.5B, 1.5B, 3B, 7B, 14B, 32B, 72B입니다. 사전 학습 데이터셋은 7조 개에서 18조 개의 토큰으로 확장되었습니다. Qwen2와 비교하여 Qwen2.5는 MMLU, 코딩 벤치마크(LiveCodeBench, MultiPL-E, MBPP) 및 수학 벤치마크(MATH)에서 개선된 성능을 보여줍니다. Qwen2.5-72B는 라마-3-405B보다 5분의 1의 매개변수로 여러 작업에서 더 뛰어난 성능을 발휘합니다. 추가 모델인 Qwen-Plus와 Qwen-Turbo는 알리바바 클라우드 모델 스튜디오 API를 통해 사용할 수 있습니다. 대부분의 모델은 아파치 2.0 라이선스를 따르지만, Qwen2.5-3B와 Qwen2.5-72B는 별도 라이선스가 적용됩니다.
출처: Alibaba Qwen —
원문
