Mô hìnhNghiên cứu 🇨🇳 28.07.2026 01:05

QwQ-32B: Khai thác sức mạnh của Học tăng cường

Alibaba/QwenAlibaba/Qwen DeepSeekDeepSeek OpenAIOpenAI
Alibaba Qwen đã công bố mô hình QwQ-32B với 32 tỷ tham số, đạt hiệu suất tương đương DeepSeek-R1 (671 tỷ tham số) thông qua học tăng cường (reinforcement learning - RL) có thể mở rộng. Mô hình được mã nguồn mở theo giấy phép Apache 2.0 và kết hợp suy luận với khả năng tác nhân.
Alibaba's Qwen đã giới thiệu mô hình QwQ-32B với 32 tỷ tham số, tận dụng học tăng cường có khả năng mở rộng (reinforcement learning - RL). Mô hình này đạt hiệu suất tương đương DeepSeek-R1, vốn có 671 tỷ tham số (trong đó 37 tỷ tham số hoạt động). Quá trình phát triển dựa trên khởi động nguội và RL hai giai đoạn: đầu tiên, trên các tác vụ toán học và lập trình sử dụng bộ xác minh tính đúng đắn và máy chủ thực thi mã để xác thực giải pháp; sau đó, trên các khả năng tổng quát sử dụng mô hình phần thưởng tổng quát và các quy tắc. QwQ-32B tích hợp các khả năng tác nhân, cho phép mô hình tư duy phản biện, sử dụng công cụ và thích ứng với phản hồi từ môi trường. Mô hình được phát hành dưới dạng trọng số mở trên Hugging Face và ModelScope theo giấy phép Apache 2.0, cũng như thông qua Qwen Chat và API DashScope. Trong tương lai, Qwen có kế hoạch kết hợp các mô hình nền tảng mạnh hơn với tính toán RL có thể mở rộng để tiến gần hơn đến trí tuệ nhân tạo tổng quát (artificial general intelligence - AGI) và tích hợp các tác nhân với RL để suy luận dài hạn.
Nguồn: Alibaba Qwen — bản gốc
Bài viết liên quan trước đây ↓
Tin mới