Qwen VLo:Alibabaの統合マルチモーダル理解・生成モデル
Alibaba/Qwen
AlibabaがQwen VLoをリリース。これは画像の理解と生成の両方を統合したマルチモーダルモデルであり、オープンエンドな編集、多言語指示、動的解像度、上から下、左から右へのプログレッシブ生成をサポートする。Qwen Chatでプレビュー版が利用可能。
AlibabaがQwen VLoを発表。これは画像の理解と生成の両方が可能な、新たな統合型マルチモーダルモデルである。本モデルは従来のQwenVLシリーズからアップグレードされ、認識と生成を橋渡しする。プログレッシブ生成方式を採用し、画像を左から右へ、上から下へと徐々に構築していく。Qwen VLoは、正確なコンテンツ理解、オープンエンドな指示ベースの編集(スタイル変換、オブジェクト変更、背景変更)、多言語指示(中国語と英語)、任意のアスペクト比に対応した動的解像度をサポートする。また、編集コマンドを介して深度マップ予測、セグメンテーション、エッジ検出などの視覚認識タスクも実行可能である。本モデルはプレビュー段階にあり、Qwen Chatを通じて利用できる。制限事項として、時折の不正確さや不整合が挙げられる。
出典: Alibaba Qwen —
原文
