Alibaba merilis Qwen2.5-VL: model multimodal andalan baru
Alibaba/Qwen
Alibaba memperkenalkan Qwen2.5-VL — generasi baru model vision-language yang tersedia dalam ukuran 3B, 7B, dan 72B. Model ini menonjol dengan pemahaman visual yang lebih baik, dukungan video berdurasi lebih dari satu jam, kemampuan untuk tindakan agen, dan keluaran terstruktur.
Группа Qwen из Alibaba выпустила Qwen2.5-VL — новую флагманскую модель для зрения и языка. Модель доступна в трех размерах: 3B, 7B и 72B, как в базовой (base), так и в инструктивной (instruct) версии, на платформах Hugging Face и ModelScope. Модель способна распознавать объекты, тексты, диаграммы, а также действовать как визуальный агент: управлять компьютером или телефоном. Она понимает видео длительностью более часа и может локализовать события во времени. Модель поддерживает точную локализацию объектов с помощью ограничивающих рамок (bounding boxes) и ключевых точек, а также структурированный вывод в формате JSON для документов, счетов и таблиц. Флагманская модель Qwen2.5-VL-72B-Instruct показывает конкурентоспособные результаты на эталонных тестах, включая задачи уровня колледжа, математику, понимание документов и видео. Меньшие версии (7B) превосходят GPT-4o-mini по ряду задач, а версия 3B, предназначенная для граничных вычислений (edge AI), превосходит предыдущую модель 7B. Также улучшено распознавание изображений: теперь модель охватывает огромное количество категорий, включая растения, животных, достопримечательности, персонажей фильмов и товары. Модель использует формат HTML для разметки документов (QwenVL HTML).
Sumber: Alibaba Qwen —
asli
