визуального агента: управлять компьютером или телефоном. Она понимает видео длительностью более часа и способна локализовать события во времени. Модель поддерживает точную локализацию объектов с помощью ограничивающих рамок (bounding boxes) и ключевых точек, а также структурированный вывод в формате JSON для документов, счетов и таблиц. Флагманская модель Qwen2.5-VL-72B-Instruct показывает конкурентоспособные результаты на бенчмарках, включая задачи уровня колледжа, математику, понимание документов и видео. Меньшие версии (7B) превосходят GPT-4o-mini по ряду задач, а версия 3B, предназначенная для периферийного искусственного интеллекта (edge AI), превосходит предыдущую модель с 7B параметров. Также улучшено распознавание изображений: теперь модель охватывает огромное количество категорий, включая растения, животных, достопримечательности, персонажей фильмов и товары. Модель использует HTML-формат для разметки документов (QwenVL HTML).