알리바바, Qwen2.5-Math 출시: 최첨단 오픈 수학 LLM
Alibaba/Qwen
OpenAI
Google/DeepMind
Anthropic
알리바바가 Qwen2.5-Math를 공개했습니다. 이는 1.5B에서 72B 파라미터 모델을 포함하는 새로운 오픈 수학 언어 모델 시리즈로, 영어와 중국어 수학 문제를 연쇄적 사고 및 통합 도구적 사고로 해결하며, 이전 세대 Qwen2-Math를 크게 능가합니다.
알리바바가 Qwen2.5-Math를 출시했습니다. 이는 새로운 오픈 수학 LLM(대규모 언어 모델) 시리즈로, 기본 모델인 Qwen2.5-Math-1.5B/7B/72B, 인스트럭트 버전, 그리고 수학 보상 모델인 Qwen2.5-Math-RM-72B를 포함합니다. Qwen2-Math와 달리, 새 모델은 영어와 중국어 문제를 체인 오브 소트(CoT)와 통합 도구 기반 추론(TIR)을 사용하여 풀 수 있습니다. TIR을 통해 계산 정확도를 높이고 복잡한 알고리즘 연산을 수행할 수 있습니다. MATH 벤치마크에서 Qwen2.5-Math-1.5B/7B/72B-Instruct 모델은 TIR을 적용하여 각각 79.7, 85.3, 87.8점을 기록했습니다. 사전 학습에는 1조 개 이상의 토큰으로 구성된 Qwen Math Corpus v2가 사용되었습니다. 72B-Instruct 모델은 GPT-4o와 Gemini Math-Specialized 1.5 Pro를 능가하여 TIR 사용 시 MATH에서 92.9점을 받았습니다. 7B-Instruct 모델은 Qwen2-Math-72B-Instruct를 능가했습니다. 고난도 올림피아드 테스트인 AIME 2024와 AMC 2023에서도 높은 성과를 보였습니다. 데이터 오염을 방지하기 위해 디콘타미네이션이 수행되었습니다. TIR을 지원하는 데모 버전이 제공됩니다.
출처: Alibaba Qwen —
원문
