Qwen2-VL: Alibaba Merilis Generasi Baru Model Visi-Bahasa dengan Performa SoTA
Alibaba/Qwen
Alibaba memperkenalkan Qwen2-VL, generasi baru model visi-bahasa yang secara signifikan melampaui pendahulunya dalam pemahaman gambar, video, dan kemampuan agen multimodal. Model 2B dan 7B dirilis sebagai sumber terbuka di bawah lisensi Apache 2.0, sementara model 72B tersedia melalui API. Qwen2-VL-72B menunjukkan performa yang melampaui GPT-4o dan Claude 3.5-Sonnet di banyak tolok ukur, terutama dalam pemahaman dokumen.
Alibaba telah merilis Qwen2-VL, generasi baru model vision-language yang didasarkan pada Qwen2. Model dengan parameter 2 miliar dan 7 miliar dibuka di bawah lisensi Apache 2.0, sementara model 72 miliar tersedia melalui API. Qwen2-VL mencapai hasil state-of-the-art pada tolok ukur MathVista, DocVQA, RealWorldQA, MTVQA. Model ini mampu memahami video dengan durasi lebih dari 20 menit dan berintegrasi dengan perangkat untuk operasi otomatis. Mendukung multibahasa, termasuk bahasa Eropa, Jepang, Korea, Arab, Vietnam. Qwen2-VL menggunakan Vision Transformer dengan 600 juta parameter dan mendukung resolusi dinamis. Embedding posisi multimodal M-ROPE diperkenalkan untuk menangkap informasi teks, visual, dan video secara simultan. Model ini menunjukkan keunggulan dalam pemahaman dokumen dan pemecahan masalah, melampaui GPT-4o dan Claude 3.5-Sonnet. Keterbatasan model: tidak ada ekstraksi audio dari video, pengetahuan hingga Juni 2023, kesulitan dalam penghitungan dan pengenalan karakter.
Sumber: Alibaba Qwen —
asli
