モデルオープンソース 🇨🇳 28.07.2026 01:05

Alibaba、Qwen2.5-VL-32Bをオープンソース化:よりスマートに、より軽量に

Alibaba/QwenAlibaba/Qwen
Alibabaは、320億パラメータの視覚言語モデルQwen2.5-VL-32B-InstructをApache 2.0ライセンスでオープンソース化しました。同モデルは、Mistral-Small-3.1-24BやGemma-3-27B-ITを上回り、多モーダル推論ベンチマーク(MMMUやMathVistaなど)では、より大規模なQwen2-VL-72B-Instructをも凌駕します。このモデルは、強化学習により人間とのアライメントと数学的推論能力が最適化されています。
アリババのQwenチームは、320億パラメータを持つ視覚言語モデル「Qwen2.5-VL-32B-Instruct」のリリースを発表しました。本モデルはApache 2.0ライセンスでオープンソース化されており、Qwen2.5-VLシリーズを基盤とし、強化学習を用いて最適化されています。主な改善点として、人間の嗜好により沿った応答、数学的推論精度の向上、そしてきめ細かな画像理解と推論が挙げられます。広範なベンチマーク評価において、Qwen2.5-VL-32B-Instructは同等規模の最先端モデルであるMistral-Small-3.1-24BやGemma-3-27B-ITを凌駕し、さらに複雑なマルチモーダルタスク(MMMU、MMMU-Pro、MathVistaなど)では、より大規模なQwen2-VL-72B-Instructをも上回る性能を示しました。また、同規模での純粋なテキスト能力においてもトップレベルの性能を達成しています。チームは今後、高度に複雑な視覚的推論タスクに対応するための、長く効果的な推論プロセスに注力する予定です。
出典: Alibaba Qwen — 原文
関連記事 ↓
新着ニュース