QwQ-32B: 강화 학습의 힘을 활용하다
Alibaba/Qwen
DeepSeek
OpenAI
알리바바의 Qwen 팀이 320억 개의 파라미터를 가진 QwQ-32B 모델을 공개했습니다. 이 모델은 확장 가능한 강화 학습(Reinforcement Learning, RL)을 통해 DeepSeek-R1(6710억 파라미터)과 견줄 만한 성능을 달성했습니다. 이 모델은 Apache 2.0 라이선스로 오픈소스화되었으며, 추론과 에이전트 기능을 결합했습니다.
알리바바의 Qwen이 320억 개의 파라미터를 가진 QwQ-32B 모델을 출시했으며, 확장 가능한 강화학습(RL)을 활용했다. 이 모델은 6710억 개의 파라미터(그중 370억 개가 활성화됨)를 가진 DeepSeek-R1과 필적하는 성능을 달성했다. 개발은 콜드 스타트와 2단계 RL을 기반으로 한다. 첫 번째 단계에서는 수학 및 프로그래밍 과제에 대해 정답 검증기와 코드 실행 서버를 사용하여 솔루션을 검증하고, 두 번째 단계에서는 일반 보상 모델과 규칙을 사용하여 일반 능력을 향상시킨다. QwQ-32B는 에이전트 기능을 통합하여 모델이 비판적으로 사고하고, 도구를 사용하며, 환경의 피드백에 적응할 수 있도록 한다. 이 모델은 Apache 2.0 라이선스 하에 Hugging Face와 ModelScope에서 오픈 웨이트로 제공되며, Qwen Chat 및 DashScope API를 통해서도 이용할 수 있다. 향후 Qwen은 더 강력한 기본 모델과 확장 가능한 RL 계산을 결합하여 인공 일반 지능(AGI)에 접근하고, 에이전트와 RL을 통합하여 장기 추론을 수행할 계획이다.
출처: Alibaba Qwen —
원문
