Qwen2-VL: Alibaba выпускает новое поколение моделей зрения-языка с SoTA производительностью
Alibaba/Qwen
Alibaba представила Qwen2-VL — новое поколение vision-language моделей, которые значительно превосходят предшественника по пониманию изображений, видео и мультимодальных агентских возможностей. Модели 2B и 7B открыты под лицензией Apache 2.0, а 72B доступна через API. Qwen2-VL-72B демонстрирует производительность, превосходящую GPT-4o и Claude 3.5-Sonnet на многих бенчмарках, особенно в понимании документов.
Компания Alibaba выпустила Qwen2-VL — новое поколение vision-language моделей на базе Qwen2. Модели с 2 миллиардами и 7 миллиардами параметров открыты под лицензией Apache 2.0, а версия с 72 миллиардами параметров доступна через API. Qwen2-VL достигает передовых результатов на бенчмарках MathVista, DocVQA, RealWorldQA, MTVQA. Модель способна понимать видео длительностью более 20 минут и
Показать ещё ↓
Источник: Alibaba Qwen —
оригинал
