알리바바, 새로운 플래그십 멀티모달 모델 Qwen2.5-VL 출시
Alibaba/Qwen
알리바바가 Qwen2.5-VL을 공개했습니다. 이는 비전-언어 모델의 새로운 세대로, 3B, 7B, 72B 크기로 제공됩니다. 이 모델은 향상된 시각적 이해, 1시간 이상의 비디오 지원, 에이전트 액션 및 구조화된 출력 기능이 특징입니다.
Команда Qwen из Alibaba выпустила Qwen2.5-VL — новую флагманскую модель для зрения и языка. Она доступна в трёх размерах: 3 миллиарда, 7 миллиардов и 72 миллиарда параметров, как в базовой, так и в инструктивной версии, на платформах Hugging Face и ModelScope. Модель может распознавать объекты, тексты, диаграммы, а также работать в качестве визуального агента: управлять компьютером или телефоном. Она понимает видео длительностью более часа и способна локализовать события во времени. Модель поддерживает точную локализацию объектов с помощью ограничивающих рамок и ключевых точек, а также структурированный вывод в формате JSON для документов, счетов и таблиц. Флагманская модель Qwen2.5-VL-72B-Instruct показывает конкурентоспособные результаты на эталонных тестах, включая задачи уровня колледжа, математику, понимание документов и видео. Меньшие версии (7 миллиардов параметров) превосходят GPT-4o-mini по ряду задач, а версия с 3 миллиардами параметров, предназначенная для граничного искусственного интеллекта, превосходит предыдущую модель с 7 миллиардами параметров. Также улучшено распознавание изображений: теперь модель охватывает огромное количество категорий, включая растения, животных, достопримечательности, персонажей фильмов и товары. Модель использует формат HTML для разметки документов (QwenVL HTML).
출처: Alibaba Qwen —
원문
