النماذجالأبحاث 🇨🇳 28.07.2026 19:03

Qwen2-VL: ألibaba تطلق الجيل الجديد من نماذج الرؤية واللغة بأداء متطور

Alibaba/QwenAlibaba/Qwen
أعلنت ألibaba عن Qwen2-VL، الجيل الجديد من نماذج الرؤية واللغة، والتي تتفوق بشكل كبير على سابقتها في فهم الصور والفيديو والقدرات الوكيلة متعددة الوسائط. النماذج 2B و7B مفتوحة المصدر بموجب ترخيص Apache 2.0، بينما يتوفر 72B عبر واجهة برمجة التطبيقات. يُظهر Qwen2-VL-72B أداءً يتجاوز GPT-4o وClaude 3.5-Sonnet في العديد من المعايير، خاصة في فهم المستندات.
Alibaba выпустила Qwen2-VL, новое поколение vision-language моделей на основе Qwen2. Модели 2B и 7B открыты под лицензией Apache 2.0, а 72B доступна через API. Qwen2-VL достигает state-of-the-art результатов на бенчмарках MathVista, DocVQA, RealWorldQA, MTVQA. Модель способна понимать видео длительностью более 20 минут и интегрироваться с устройствами для автоматических операций. Поддерживает многоязычность, включая европейские языки, японский, корейский, арабский, вьетнамский. Qwen2-VL использует Vision Transformer с 600M параметров и поддерживает динамическое разрешение. Введена мультимодальная позиционная эмбеддинг M-ROPE для одновременного захвата текстовой, визуальной и видеоинформации. Модель демонстрирует превосходство в понимании документов и решении задач, превосходя GPT-4o и Claude 3.5-Sonnet. Ограничения модели: отсутствие извлечения аудио из видео, знания до июня 2023, трудности в подсчёте и распознавании символов.
المصدر: Alibaba Qwen — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة