ModellerAraştırma 🇨🇳 28.07.2026 19:03

Qwen2-VL: Alibaba, SoTA Performanslı Yeni Nesil Görme-Dil Modellerini Yayınladı

Alibaba/QwenAlibaba/Qwen
Alibaba, Qwen2-VL'yi tanıttı — selefine göre görüntü, video ve çok modlu ajan yeteneklerini anlamada önemli ölçüde üstün olan yeni nesil görme-dil modelleri. 2B ve 7B modelleri Apache 2.0 lisansı altında açık kaynaklıdır, 72B ise API aracılığıyla kullanılabilir. Qwen2-VL-72B, birçok kıyaslamada, özellikle belge anlamada GPT-4o ve Claude 3.5-Sonnet'i geride bırakan bir performans sergiler.
Alibaba, Qwen2 tabanlı yeni nesil görsel-dil modelleri olan Qwen2-VL'yi yayınladı. 2B ve 7B modelleri Apache 2.0 lisansı altında açık kaynak olarak sunulurken, 72B modeline API üzerinden erişilebiliyor. Qwen2-VL, MathVista, DocVQA, RealWorldQA ve MTVQA kıyaslamalarında son teknoloji sonuçlara ulaşıyor. Model, 20 dakikadan uzun süreli videoları anlayabiliyor ve otomatik işlemler için cihazlarla entegre olabiliyor. Avrupa dilleri, Japonca, Korece, Arapça ve Vietnamca dahil olmak üzere çok dilliliği destekliyor. Qwen2-VL, 600 milyon parametreli Vision Transformer kullanıyor ve dinamik çözünürlüğü destekliyor. Metin, görsel ve video bilgilerini aynı anda yakalamak için çok modlu konumsal yerleştirme M-ROPE (Multimodal Rotary Position Embedding) tanıtıldı. Model, belge anlama ve görev çözmede GPT-4o ve Claude 3.5-Sonnet'i geride bırakarak üstünlük gösteriyor. Modelin sınırlamaları: videolardan ses çıkaramama, bilgilerin Haziran 2023'e kadar olması, sayma ve karakter tanımada zorluklar.
Kaynak: Alibaba Qwen — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler