Alibaba Qwen、QVQ-Maxをリリース:証明付き視覚推論モデル
Alibaba/Qwen
Alibaba Qwenは、視覚推論モデルの初版となるQVQ-Maxを正式にリリースしました。このモデルは、画像や動画の認識だけでなく、分析、推論、解決策の提示が可能です。MathVisionベンチマークでは、思考プロセスの長さが増すにつれて、QVQ-Maxの精度が一貫して向上することが示されています。
アリババ社のQwenは、初のビジュアル推論モデルとなるQVQ-Maxを発表した。このモデルは画像や動画に基づいて分析・推論を行い、数学から日常的な問題まで幅広いタスクを解決できる。多様なマルチモーダル数学タスクを含むMathVisionベンチマークにおいて、QVQ-Maxは思考連鎖の最大長が増加するにつれて精度が向上することを示している。同モデルの主な能力には、詳細な観察、深い推論、および柔軟な適用が含まれる。ユースケースとしては、仕事、学習、日常生活での支援が挙げられる。今後の計画としては、認識精度の向上、マルチステップタスクの実行、および他のモダリティとのインタラクションの改善が予定されている。
出典: Alibaba Qwen —
原文
