알리바바, Qwen-Image 출시: 텍스트 정확도 높은 이미지 생성을 위한 200억 파라미터 MMDiT 모델
Alibaba/Qwen
알리바바의 Qwen 팀이 Qwen-Image를 출시했습니다. 이는 200억 개의 파라미터를 가진 MMDiT 이미지 파운데이션 모델로, 복잡한 텍스트 렌더링(중국어-영어 이중 언어 포함), 일관된 이미지 편집, 그리고 GenEval 및 DPG와 같은 벤치마크에서 뛰어난 성능을 보여줍니다. 이 모델은 포스터 제작, 슬라이드 생성, 작은 영역에 대한 정밀한 텍스트 렌더링을 지원합니다.
알리바바의 Qwen 팀이 200억 파라미터 규모의 MMDiT 이미지 기반 모델인 Qwen-Image를 출시했습니다. 이 모델은 생성 부문의 GenEval, DPG, OneIG-Bench, 편집 부문의 GEdit, ImgEdit, GSO, 텍스트 렌더링 부문의 LongText-Bench, ChineseWord, TextCraft와 같은 벤치마크에서 최첨단 성능을 달성했습니다. 이 모델은 알파벳 언어(예: 영어)와 표어 문자 언어(예: 중국어) 모두에서 복잡한 여러 줄 텍스트를 렌더링하는 데 탁월하며, 손글씨 텍스트, 포스터, 파워포인트 슬라이드, 이중 언어 콘텐츠를 포함합니다. 또한 스타일 전환, 객체 추가/삭제, 텍스트 편집과 같은 일관된 이미지 편집 작업을 지원합니다. 이 모델은 이미지의 10분의 1 미만을 차지하는 종이 위의 문단과 같은 작은 텍스트도 정확하게 렌더링할 수 있습니다. Qwen-Image는 Qwen Chat과 GitHub, Hugging Face, ModelScope와 같은 플랫폼에서 이용할 수 있습니다.
출처: Alibaba Qwen —
원문
