Qwen VLo: Model multimodal terpadu untuk pemahaman dan generasi dari Alibaba
Alibaba/Qwen
Alibaba merilis Qwen VLo, sebuah model multimodal terpadu yang dapat memahami dan menghasilkan gambar. Model ini mendukung pengeditan terbuka, instruksi multibahasa, resolusi dinamis, dan generasi progresif dari atas ke bawah serta kiri ke kanan. Tersedia sebagai pratinjau di Qwen Chat.
Alibaba memperkenalkan Qwen VLo, model multimodal terpadu baru yang dapat memahami sekaligus menghasilkan gambar. Model ini merupakan peningkatan dari seri QwenVL sebelumnya, yang menjembatani persepsi dan kreasi. Model ini menggunakan metode pembuatan progresif, membangun gambar secara bertahap dari kiri ke kanan dan atas ke bawah. Qwen VLo mendukung pemahaman konten yang presisi, pengeditan berbasis instruksi terbuka (transfer gaya, modifikasi objek, perubahan latar belakang), instruksi multibahasa (Bahasa Mandarin dan Bahasa Inggris), serta resolusi dinamis dengan rasio aspek arbitrer. Model ini juga dapat melakukan tugas persepsi visual seperti prediksi peta kedalaman, segmentasi, dan deteksi tepi melalui perintah pengeditan. Model ini masih dalam tahap pratinjau dan tersedia melalui Qwen Chat. Keterbatasannya meliputi ketidakakuratan dan inkonsistensi yang kadang terjadi.
Sumber: Alibaba Qwen —
asli
