Mô hìnhSinh phương tiện 🇨🇳 27.07.2026 18:04

Qwen VLo: Mô hình đa phương thức thống nhất của Alibaba cho hiểu và sinh hình ảnh

Alibaba/QwenAlibaba/Qwen
Alibaba phát hành Qwen VLo, một mô hình đa phương thức thống nhất có khả năng vừa hiểu vừa sinh hình ảnh. Mô hình hỗ trợ chỉnh sửa mở, hướng dẫn đa ngôn ngữ, độ phân giải động và sinh ảnh dần dần từ trên xuống dưới, từ trái sang phải. Hiện có bản xem trước trên Qwen Chat.
Alibaba giới thiệu Qwen VLo, mô hình đa phương thức thống nhất mới có khả năng vừa hiểu vừa tạo ra hình ảnh. Mô hình này là bản nâng cấp từ dòng QwenVL trước đó, kết nối giữa nhận thức và sáng tạo. Nó sử dụng phương pháp tạo dần dần, xây dựng hình ảnh từ trái sang phải và từ trên xuống dưới. Qwen VLo hỗ trợ hiểu nội dung chính xác, chỉnh sửa dựa trên hướng dẫn mở (chuyển đổi phong cách, sửa đổi đối tượng, thay đổi nền), hướng dẫn đa ngôn ngữ (tiếng Trung và tiếng Anh) và độ phân giải động với tỷ lệ khung hình tùy ý. Nó cũng có thể thực hiện các tác vụ nhận thức thị giác như dự đoán bản đồ độ sâu, phân đoạn và phát hiện cạnh thông qua các lệnh chỉnh sửa. Mô hình đang trong giai đoạn xem trước và có sẵn qua Qwen Chat. Các hạn chế bao gồm đôi khi có sự không chính xác và không nhất quán.
Nguồn: Alibaba Qwen — bản gốc
Bài viết liên quan trước đây ↓
Tin mới