Qwen2.5-Max: 대규모 MoE 모델의 성능 탐구
Alibaba/Qwen
알리바바 큐원이 Mixture-of-Experts 아키텍처를 기반으로 한 대규모 언어 모델인 Qwen2.5-Max를 출시했습니다. 이 모델은 20조 개 이상의 토큰으로 학습되었으며, 여러 벤치마크에서 DeepSeek V3를 능가하는 성능을 보여줍니다. 알리바바 클라우드 API와 Qwen Chat을 통해 사용 가능합니다.
Qwen 팀이 Mixture-of-Experts(MoE) 아키텍처를 기반으로 하는 대규모 언어 모델 Qwen2.5-Max를 출시했습니다. 이 모델은 20조 개 이상의 토큰으로 사전 학습된 후, 지도 학습 파인튜닝(SFT)과 인간 피드백 기반 강화 학습(RLHF)이 적용되었습니다. MMLU-Pro, LiveCodeBench, LiveBench, Arena-Hard, GPQA-Diamond 벤치마크에서 DeepSeek V3, GPT-4o, Claude-3.5-Sonnet과 비교되었습니다. Qwen2.5-Max는 Arena-Hard, LiveBench, LiveCodeBench, GPQA-Diamond에서 DeepSeek V3를 능가했으며, MMLU-Pro에서는 경쟁력 있는 결과를 보였습니다. 기본 모델의 경우 DeepSeek V3, Llama-3.1-405B, Qwen2.5-72B와 비교되었는데, Qwen2.5-Max는 대부분의 테스트에서 상당한 우위를 보였습니다. 이 모델은 Qwen Chat과 알리바바 클라우드 API(모델명: qwen-max-2025-01-25)를 통해 사용할 수 있으며, API는 OpenAI API와 호환됩니다.
출처: Alibaba Qwen —
원문
