알리바바, Qwen2.5-Math 출시: 최첨단 오픈 수학 LLM
Alibaba/Qwen
OpenAI
Google/DeepMind
Anthropic
알리바바가 Qwen2.5-Math를 공개했습니다. 이는 1.5B에서 72B 파라미터에 이르는 새로운 오픈 수학 언어 모델 시리즈입니다. 이 모델들은 영어와 중국어로 수학 문제를 해결할 수 있으며, 추론 체인(chain-of-thought)과 통합 도구 사용(integrated tool-using) 방식을 지원합니다. 이전 세대인 Qwen2-Math보다 훨씬 뛰어난 성능을 보여줍니다.
알리바바가 Qwen2.5-Math를 출시했습니다. 이는 새로운 오픈 수학 LLM(대규모 언어 모델) 시리즈로, 기본 모델인 Qwen2.5-Math-1.5B/7B/72B, 인스트럭트 버전, 그리고 수학 보상 모델인 Qwen2.5-Math-RM-72B를 포함합니다. Qwen2-Math와 달리, 새 모델은 영어와 중국어 문제를 체인 오브 소트(CoT)와 통합 도구 기반 추론(TIR)을 사용하여 풀 수 있습니다. TIR을 통해 계산 정확도를 높이고 복잡한 알고리즘 연산을 수행할 수 있습니다. MATH 벤치마크에서 Qwen2.5-Math-1.5B/7B/72B-Instruct 모델은 TIR을 적용하여 각각 79.7, 85.3, 87.8점을 기록했습니다. 사전 학습에는 1조 개 이상의 토큰으로 구성된 Qwen Math Corpus v2가 사용되었습니다. 72B-Instruct 모델은 GPT-4o와 Gemini Math-Specialized 1.5 Pro를 능가하여 TIR 사용 시 MATH에서 92.9점을 받았습니다. 7B-Instruct 모델은 Qwen2-Math-72B-Instruct를 능가했습니다. 고난도 올림피아드 테스트인 AIME 2024와 AMC 2023에서도 높은 성과를 보였습니다. 데이터 오염을 방지하기 위해 디콘타미네이션이 수행되었습니다. TIR을 지원하는 데모 버전이 제공됩니다.
출처: Alibaba Qwen —
원문
