Mô hìnhSinh phương tiện 🇨🇳 27.07.2026 17:05

Alibaba ra mắt Qwen-Image: mô hình MMDiT 20 tỷ tham số cho tạo ảnh chính xác theo văn bản

Alibaba/QwenAlibaba/Qwen
Nhóm Qwen của Alibaba đã phát hành Qwen-Image, một mô hình nền tảng ảnh MMDiT với 20 tỷ tham số, vượt trội trong việc hiển thị văn bản phức tạp (bao gồm song ngữ Trung-Anh), chỉnh sửa ảnh nhất quán và đạt hiệu suất cao trên các chuẩn như GenEval và DPG. Mô hình hỗ trợ tạo poster, tạo slide và hiển thị văn bản chính xác trên các vùng nhỏ.
Nhóm Qwen của Alibaba vừa công bố Qwen-Image, một mô hình nền tảng hình ảnh MMDiT với 20 tỷ tham số. Mô hình đạt kết quả tiên tiến nhất trên các điểm chuẩn như GenEval, DPG, OneIG-Bench cho tạo sinh; GEdit, ImgEdit, GSO cho chỉnh sửa; và LongText-Bench, ChineseWord, TextCraft cho hiển thị văn bản. Mô hình này xuất sắc trong việc hiển thị văn bản đa dòng phức tạp ở cả ngôn ngữ bảng chữ cái (ví dụ, tiếng Anh) và ngôn ngữ tượng hình (ví dụ, tiếng Trung), bao gồm văn bản viết tay, áp phích, slide PowerPoint và nội dung song ngữ. Nó cũng hỗ trợ các thao tác chỉnh sửa hình ảnh nhất quán như chuyển đổi phong cách, thêm/xóa đối tượng và chỉnh sửa văn bản. Mô hình có thể hiển thị chính xác văn bản nhỏ, chẳng hạn như một đoạn văn trên giấy chiếm ít hơn một phần mười diện tích ảnh. Qwen-Image có sẵn qua Qwen Chat và trên các nền tảng như GitHub, Hugging Face và ModelScope.
Nguồn: Alibaba Qwen — bản gốc
Bài viết liên quan trước đây ↓
Tin mới