QwQ-32B: Die Kraft des bestärkenden Lernens nutzen
Alibaba/Qwen
DeepSeek
OpenAI
Alibaba Qwen hat das Modell QwQ-32B mit 32 Milliarden Parametern vorgestellt, das durch skalierbares bestärkendes Lernen eine mit DeepSeek-R1 (671 Milliarden Parameter) vergleichbare Leistung erzielt. Das Modell wird unter der Apache-2.0-Lizenz als Open Source bereitgestellt und kombiniert Schlussfolgerungsfähigkeiten mit Agentenfunktionen.
Alibabas Qwen hat das Modell QwQ-32B mit 32 Milliarden Parametern vorgestellt, das skalierbares Reinforcement Learning (RL) nutzt. Das Modell erreicht eine mit DeepSeek-R1 vergleichbare Leistung, das 671 Milliarden Parameter hat (von denen 37 Milliarden aktiv sind). Die Entwicklung basiert auf einem Kaltstart und zweistufigem RL: Zunächst bei mathematischen und Programmieraufgaben mithilfe eines Korrektheitsverifikators und eines Code-Ausführungsservers zur Validierung von Lösungen; anschließend bei allgemeinen Fähigkeiten mithilfe eines allgemeinen Belohnungsmodells und Regeln. QwQ-32B integriert Agentenfähigkeiten, die es dem Modell ermöglichen, kritisch zu denken, Werkzeuge zu nutzen und sich an Rückmeldungen aus der Umgebung anzupassen. Das Modell ist als offene Gewichte auf Hugging Face und ModelScope unter der Apache-2.0-Lizenz sowie über Qwen Chat und die DashScope API verfügbar. In Zukunft plant Qwen, stärkere Basismodelle mit skalierbarem RL zu kombinieren, um sich der künstlichen Allgemeinintelligenz (Artificial General Intelligence, AGI) anzunähern, und Agenten mit RL für langfristiges Denken zu integrieren.
Quelle: Alibaba Qwen —
Original
