Alibaba Qwen, QVQ-Max'i Yayınladı: Kanıtlarla Görsel Akıl Yürütme Modeli
Alibaba/Qwen
Alibaba Qwen, QVQ-Max'i resmi olarak yayınladı: görsel akıl yürütme modelinin ilk sürümü. Model yalnızca görselleri ve videoları tanımakla kalmıyor, aynı zamanda analiz ediyor, akıl yürütüyor ve çözümler sunuyor. MathVision kıyaslamasında QVQ-Max, düşünce sürecinin uzunluğu arttıkça tutarlı bir doğruluk iyileştirmesi sergiliyor.
Alibaba'nın Qwen'i, ilk görsel akıl yürütme modeli olan QVQ-Max'i tanıttı. Model, görseller ve videolara dayanarak analiz yapıp akıl yürütebiliyor; matematik problemlerinden günlük sorunlara kadar çeşitli görevleri çözüyor. Çeşitli çoklu ortam matematik görevlerini içeren MathVision kıyaslamasında, QVQ-Max, maksimum düşünce zinciri uzunluğu arttıkça daha yüksek doğruluk gösteriyor. Modelin temel yetenekleri arasında ayrıntılı gözlem, derin akıl yürütme ve esnek uygulama bulunuyor. Kullanım alanları arasında iş, öğrenme ve günlük hayata yardım yer alıyor. Gelecek planları, tanıma doğruluğunun iyileştirilmesi, çok adımlı görev yürütme ve diğer ortamlarla etkileşimi içeriyor.
Kaynak: Alibaba Qwen —
orijinal
