AlibabaがQwen2.5-VLをリリース:新たなフラッグシップマルチモーダルモデル
Alibaba/Qwen
AlibabaはQwen2.5-VLを発表しました。これはビジョン・ランゲージモデルの新世代であり、3B、7B、72Bのサイズで利用可能です。このモデルは、改良された視覚的理解、1時間以上の動画サポート、エージェント動作能力、構造化出力を特長としています。
アリババグループのQwenチームは、新しいフラッグシップ視覚言語モデル「Qwen2.5-VL」をリリースしました。このモデルは3B、7B、72Bの3サイズで提供され、ベース版とインストラクト版の両方がHugging FaceとModelScopeで公開されています。オブジェクト、テキスト、図表の認識に加え、ビジュアルエージェントとしてコンピュータやスマートフォンを操作することも可能です。1時間を超える動画を理解し、時間的なイベントの位置特定ができます。バウンディングボックスやキーポイントによる正確なオブジェクト位置特定、文書・請求書・表に対するJSON形式の構造化出力もサポートしています。フラッグシップモデルのQwen2.5-VL-72B-Instructは、大学レベルの課題、数学、文書理解、動画理解などのベンチマークで競争力のある結果を示しています。小型版(7B)は多くのタスクでGPT-4o-miniを上回り、エッジAI向けの3B版は従来の7Bモデルを超える性能を発揮します。画像認識も改善され、植物、動物、ランドマーク、映画キャラクター、商品など膨大なカテゴリをカバーします。また、文書マークアップにはHTML形式(QwenVL HTML)を採用しています。
出典: Alibaba Qwen —
原文
