Qwen2-VL: ألي بابا تطلق الجيل الجديد من نماذج الرؤية واللغة بأداء متطور
Alibaba/Qwen
كشفت ألي بابا عن Qwen2-VL، الجيل الجديد من نماذج الرؤية واللغة التي تتفوق بشكل كبير على سابقتها في فهم الصور والفيديو وقدرات العوامل متعددة الوسائط. النماذج 2B و7B متاحة كمصدر مفتوح بموجب ترخيص Apache 2.0، بينما يتوفر النموذج 72B عبر واجهة برمجة التطبيقات. يُظهر Qwen2-VL-72B أداءً يتفوق على GPT-4o وClaude 3.5-Sonnet في العديد من المعايير، خاصة في فهم المستندات.
Alibaba выпустила Qwen2-VL, новое поколение vision-language моделей на основе Qwen2. Модели 2B и 7B открыты под лицензией Apache 2.0, а 72B доступна через API. Qwen2-VL достигает state-of-the-art результатов на бенчмарках MathVista, DocVQA, RealWorldQA, MTVQA. Модель способна понимать видео длительностью более 20 минут и интегрироваться с устройствами для автоматических операций. Поддерживает многоязычность, включая европейские языки, японский, корейский, арабский, вьетнамский. Qwen2-VL использует Vision Transformer с 600M параметров и поддерживает динамическое разрешение. Введена мультимодальная позиционная эмбеддинг M-ROPE для одновременного захвата текстовой, визуальной и видеоинформации. Модель демонстрирует превосходство в понимании документов и решении задач, превосходя GPT-4o и Claude 3.5-Sonnet. Ограничения модели: отсутствие извлечения аудио из видео, знания до июня 2023, трудности в подсчёте и распознавании символов.
المصدر: Alibaba Qwen —
الأصلي
