Alibaba Open-Sources Qwen2.5-VL-32B: Lebih Cerdas dan Lebih Ringan
Alibaba/Qwen
Alibaba telah merilis sumber terbuka Qwen2.5-VL-32B-Instruct, model visi-bahasa dengan 32 miliar parameter, di bawah lisensi Apache 2.0. Model ini mengungguli Mistral-Small-3.1-24B dan Gemma-3-27B-IT, dan bahkan melampaui Qwen2-VL-72B-Instruct yang lebih besar dalam tolok ukur penalaran multimodal seperti MMMU dan MathVista. Model ini dioptimalkan melalui pembelajaran penguatan untuk keselarasan manusia dan penalaran matematika yang lebih baik.
Tim Qwen dari Alibaba mengumumkan rilis Qwen2.5-VL-32B-Instruct, model visi-bahasa dengan 32 miliar parameter, yang dirilis secara sumber terbuka di bawah lisensi Apache 2.0. Model ini dibangun berdasarkan seri Qwen2.5-VL dan dioptimalkan menggunakan pembelajaran penguatan. Peningkatan utama meliputi respons yang lebih sesuai dengan preferensi manusia, akurasi penalaran matematika yang ditingkatkan, serta pemahaman dan penalaran gambar yang terperinci. Dalam tolok ukur yang ekstensif, Qwen2.5-VL-32B-Instruct mengungguli model-model SoTA dengan skala sebanding seperti Mistral-Small-3.1-24B dan Gemma-3-27B-IT, dan bahkan melampaui Qwen2-VL-72B-Instruct yang lebih besar pada tugas multimodal kompleks seperti MMMU, MMMU-Pro, dan MathVista. Model ini juga mencapai performa terdepan dalam kemampuan teks murni pada skala yang sama. Tim berencana untuk fokus selanjutnya pada proses penalaran yang panjang dan efektif untuk tugas penalaran visual yang sangat kompleks.
Sumber: Alibaba Qwen —
asli
