モデル研究 🇨🇳 28.07.2026 19:03

Qwen2-VL:Alibaba、SoTA性能を備えた新世代ビジョン言語モデルをリリース

Alibaba/QwenAlibaba/Qwen
AlibabaはQwen2-VLを発表しました。これは新世代のビジョン言語モデルであり、画像や動画の理解、マルチモーダルエージェント機能において先行モデルを大幅に上回ります。2Bおよび7BモデルはApache 2.0ライセンスで公開され、72BはAPIを通じて利用可能です。Qwen2-VL-72Bは、多くのベンチマーク、特に文書理解においてGPT-4oやClaude 3.5-Sonnetを上回る性能を示しています。
AlibabaはQwen2-VLをリリースしました。これはQwen2をベースにした次世代の視覚言語モデルです。2Bおよび7BモデルはApache 2.0ライセンスで公開され、72BモデルはAPI経由で利用可能です。Qwen2-VLは、MathVista、DocVQA、RealWorldQA、MTVQAの各ベンチマークで最先端の成果を達成しています。このモデルは20分以上の動画を理解し、自動操作のためにデバイスと統合することができます。ヨーロッパ言語、日本語、韓国語、アラビア語、ベトナム語を含む多言語をサポートしています。Qwen2-VLは6億パラメータのVision Transformerを採用し、動的解像度をサポートしています。テキスト、視覚、ビデオ情報を同時に捉えるためのマルチモーダル位置埋め込み「M-ROPE」が導入されました。このモデルは文書理解と問題解決において優れた性能を示し、GPT-4oやClaude 3.5-Sonnetを凌駕しています。制限事項として、動画からの音声抽出は行わず、知識は2023年6月までであり、計数や文字認識に課題があります。
出典: Alibaba Qwen — 原文
関連記事 ↓
新着ニュース