QwQ-32B: Memanfaatkan Kekuatan Pembelajaran Penguatan
Alibaba/Qwen
DeepSeek
OpenAI
Alibaba Qwen meluncurkan model QwQ-32B dengan 32 miliar parameter, yang mencapai kinerja sebanding dengan DeepSeek-R1 (671 miliar parameter) melalui pembelajaran penguatan (RL) yang dapat diskalakan. Model ini dirilis sebagai sumber terbuka di bawah lisensi Apache 2.0 dan menggabungkan penalaran dengan kemampuan agen.
Alibaba melalui Qwen telah memperkenalkan model QwQ-32B dengan 32 miliar parameter, yang memanfaatkan pembelajaran penguatan (RL) yang dapat diskalakan. Model ini mencapai performa yang sebanding dengan DeepSeek-R1, yang memiliki 671 miliar parameter (di mana 37 miliar di antaranya aktif). Pengembangannya didasarkan pada cold start dan RL dua tahap: pertama, pada tugas matematika dan pemrograman menggunakan verifikator kebenaran dan server eksekusi kode untuk memvalidasi solusi; kemudian, pada kemampuan umum menggunakan model reward umum dan aturan. QwQ-32B mengintegrasikan kemampuan agen, memungkinkan model untuk berpikir kritis, menggunakan alat, dan beradaptasi dengan umpan balik dari lingkungan. Model ini tersedia sebagai bobot terbuka di Hugging Face dan ModelScope di bawah lisensi Apache 2.0, serta melalui Qwen Chat dan API DashScope. Ke depannya, Qwen berencana untuk menggabungkan model dasar yang lebih kuat dengan komputasi RL yang dapat diskalakan untuk mendekati kecerdasan umum buatan (AGI) dan mengintegrasikan agen dengan RL untuk penalaran jangka panjang.
Sumber: Alibaba Qwen —
asli
