النماذجمفتوح المصدر 🇨🇳 28.07.2026 16:03

أصدرت Alibaba نموذج Qwen2.5-VL: النموذج الرائد متعدد الوسائط الجديد

Alibaba/QwenAlibaba/Qwen
كشفت Alibaba عن Qwen2.5-VL، الجيل الجديد من نموذج الرؤية واللغة، المتوفر بأحجام 3B و7B و72B. يتميز النموذج بفهم بصري محسّن، ودعم لمقاطع الفيديو التي تزيد مدتها عن ساعة، والقدرة على القيام بإجراءات وكيلية وإخراج منظم.
Команда Qwen из Alibaba выпустила Qwen2.5-VL — новую флагманскую мультимодальную модель для зрения и языка. Она доступна в трёх размерах: 3B, 7B и 72B, как в базовой (base), так и в инструктивной (instruct) версиях, на платформах Hugging Face и ModelScope. Модель способна распознавать объекты, текст, диаграммы, а также выступать в роли визуального агента: управлять компьютером или телефоном. Она понимает видео длительностью более часа и может определять временные метки событий. Модель поддерживает точную локализацию объектов с помощью ограничивающих рамок (bounding boxes) и ключевых точек, а также структурированный вывод в формате JSON для документов, счетов и таблиц. Флагманская модель Qwen2.5-VL-72B-Instruct демонстрирует конкурентоспособные результаты на бенчмарках, включая задачи уровня колледжа, математику, понимание документов и видео. Меньшие версии (7B) превосходят GPT-4o-mini по ряду задач, а модель 3B, предназначенная для периферийного искусственного интеллекта (edge AI), превосходит предыдущую модель с 7 миллиардами параметров. Кроме того, улучшено распознавание изображений: теперь модель охватывает огромное количество категорий, включая растения, животных, достопримечательности, персонажей фильмов и товары. Модель использует формат HTML для разметки документов (QwenVL HTML).
المصدر: Alibaba Qwen — الأصلي
منشوراتنا السابقة حول هذا الموضوع ↓
أخبار جديدة