Qwen2-VL: Alibaba выпускает новое поколение моделей зрения-языка с SoTA производительностью
Alibaba/Qwen
Alibaba представила Qwen2-VL — новое поколение vision-language моделей, которые значительно превосходят предшественника по пониманию изображений, видео и мультимодальных агентских возможностей. Модели 2B и 7B открыты под лицензией Apache 2.0, а 72B доступна через API. Qwen2-VL-72B демонстрирует производительность, превосходящую GPT-4o и Claude 3.5-Sonnet на многих бенчмарках, особенно в понимании документов.
Alibaba выпустила Qwen2-VL, новое поколение vision-language моделей на основе Qwen2. Модели 2B и 7B открыты под лицензией Apache 2.0, а 72B доступна через API. Qwen2-VL достигает state-of-the-art результатов на бенчмарках MathVista, DocVQA, RealWorldQA, MTVQA. Модель способна понимать видео длительностью более 20 минут и интегрироваться с устройствами для автоматических операций. Поддерживает многоязычность, включая европейские языки, японский, корейский, арабский, вьетнамский. Qwen2-VL использует Vision Transformer с 600M параметров и поддерживает динамическое разрешение. Введена мультимодальная позиционная эмбеддинг M-ROPE для одновременного захвата текстовой, визуальной и видеоинформации. Модель демонстрирует превосходство в понимании документов и решении задач, превосходя GPT-4o и Claude 3.5-Sonnet. Ограничения модели: отсутствие извлечения аудио из видео, знания до июня 2023, трудности в подсчёте и распознавании символов.
- Сокращения
- SoTA = State of the Art
- API = Application Programming Interface
- ViT = Vision Transformer
- M-ROPE = Multimodal Rotary Position Embedding
Source: Alibaba Qwen —
original
