Alibaba、テキスト正確な画像生成のための20B MMDiTモデル「Qwen-Image」をリリース
Alibaba/Qwen
AlibabaのQwenチームは、20億パラメータのMMDiT画像基盤モデル「Qwen-Image」をリリースしました。このモデルは、複雑なテキストレンダリング(バイリンガル中国語・英語を含む)、一貫性のある画像編集、GenEvalやDPGなどのベンチマークで強力な性能を発揮します。ポスター作成、スライド生成、小さな領域への正確なテキストレンダリングをサポートします。
アリババのQwenチームは、200億パラメータのMMDiT画像基盤モデル「Qwen-Image」をリリースしました。このモデルは、生成タスクではGenEval、DPG、OneIG-Bench、編集タスクではGEdit、ImgEdit、GSO、テキストレンダリングタスクではLongText-Bench、ChineseWord、TextCraftなどのベンチマークで最先端の成果を達成しています。アルファベット言語(例:英語)と表意文字言語(例:中国語)の両方で複雑な複数行テキストを高精度にレンダリングでき、手書き文字、ポスター、PPTスライド、バイリンガルコンテンツなどに対応します。また、スタイル転送、オブジェクトの追加/削除、テキスト編集といった一貫性のある画像編集操作もサポートしています。画像の10分の1未満の面積を占める紙上の段落など、小さなテキストも正確にレンダリング可能です。Qwen-Imageは、Qwen ChatやGitHub、Hugging Face、ModelScopeなどのプラットフォームで利用できます。
出典: Alibaba Qwen —
原文
