Alibaba, Qwen2.5-VL'yi Yayınladı: Yeni Amiral Gemisi Çok Modlu Model
Alibaba/Qwen
Alibaba, Qwen2.5-VL'yi tanıttı — 3B, 7B ve 72B boyutlarında sunulan yeni nesil görüntü-dil modeli. Model, gelişmiş görsel anlama, bir saatten uzun videoları destekleme, aracı eylemler gerçekleştirme ve yapılandırılmış çıktı üretme yetenekleriyle öne çıkıyor.
Alibaba bünyesindeki Qwen grubu, yeni amiral gemisi görme ve dil modeli Qwen2.5-VL'yi yayınladı. Model, 3B, 7B ve 72B olmak üzere üç boyutta, hem base hem de instruct sürümleriyle Hugging Face ve ModelScope'da mevcut. Model nesneleri, metinleri, diyagramları tanıyabiliyor ve ayrıca görsel ajan olarak çalışabiliyor: bilgisayar veya telefonu yönetebiliyor. Bir saatten uzun süreli videoları anlıyor ve olayları zamansal olarak konumlandırabiliyor. Model, bounding box'lar ve anahtar noktalarla hassas nesne konumlandırmanın yanı sıra belgeler, faturalar ve tablolar için JSON formatında yapılandırılmış çıktıyı destekliyor. Amiral gemisi Qwen2.5-VL-72B-Instruct, üniversite düzeyindeki görevler, matematik, belge ve video anlama dahil olmak üzere kıyaslamalarda rekabetçi sonuçlar gösteriyor. Küçük sürümler (7B), bir dizi görevde GPT-4o-mini'yi geride bırakırken, uç yapay zeka için tasarlanan 3B model, önceki 7B modeli geçiyor. Görüntü tanıma da iyileştirildi: model artık bitkiler, hayvanlar, turistik yerler, film karakterleri ve ürünler dahil olmak üzere çok geniş bir kategori yelpazesini kapsıyor. Model, belge biçimlendirmesi için HTML formatını kullanıyor (QwenVL HTML).
Kaynak: Alibaba Qwen —
orijinal
