MallitTutkimus 🇨🇳 28.07.2026 01:05

QwQ-32B: Vahvistusoppimisen voiman hyödyntäminen

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI
Alibaba Qwen julkisti QwQ-32B-mallin, jossa on 32 miljardia parametria, ja se saavuttaa suorituskyvyn, joka on verrattavissa DeepSeek-R1-malliin (671 miljardia parametria) skaalautuvan vahvistusoppimisen avulla. Malli on avoimen lähdekoodin Apache 2.0 -lisenssillä ja yhdistää päättelyn agenttikapasiteetteihin.
Alibaba-yhtiön Qwen on julkaissut QwQ-32B-mallin, jossa on 32 miljardia parametria ja joka hyödyntää skaalautuvaa vahvistusoppimista. Malli saavuttaa DeepSeek-R1:n kaltaisen suorituskyvyn, vaikka DeepSeek-R1:ssä on 671 miljardia parametria (joista 37 miljardia on aktiivisia). Kehitys perustuu kylmäkäynnistykseen ja kaksivaiheiseen vahvistusoppimiseen: ensin matematiikan ja ohjelmoinnin tehtävissä, joissa käytetään oikeellisuuden tarkistinta ja koodin suorituspalvelinta ratkaisujen validointiin; sen jälkeen yleisissä kyvykkyyksissä, joissa käytetään yleistä palkkiomallia ja sääntöjä. QwQ-32B integroi agenttikapasiteetit, mikä mahdollistaa mallin kriittisen ajattelun, työkalujen käytön ja ympäristön palautteeseen sopeutumisen. Malli on avoimilla painoilla saatavilla Hugging Facessa ja ModelScopessa Apache 2.0 -lisenssillä sekä Qwen Chat- ja DashScope-rajapinnoilla. Tulevaisuudessa Qwen aikoo yhdistää vahvemmat perusmallit skaalautuvaan vahvistusoppimiseen lähestyäkseen yleistä tekoälyä ja integroida agentit vahvistusoppimiseen pitkäaikaista päättelyä varten.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset