ModelosCódigo Abierto 🇨🇳 28.07.2026 16:03

Alibaba ha lanzado Qwen2.5-VL: nuevo modelo multimodal insignia

Alibaba/QwenAlibaba/Qwen
Alibaba ha presentado Qwen2.5-VL, una nueva generación de modelo de visión y lenguaje, disponible en tamaños 3B, 7B y 72B. El modelo se destaca por su comprensión visual mejorada, soporte para videos de más de una hora de duración, capacidad para acciones autónomas y salida estructurada.
Группа Qwen компании Alibaba выпустила Qwen2.5-VL — новую флагманскую модель для vision-language. Она доступна в трёх размерах: 3B, 7B и 72B, как в базовой, так и в instruct версиях, на платформах Hugging Face и ModelScope. Модель способна распознавать объекты, тексты, диаграммы, а также работать в качестве визуального агента, управляя компьютером или телефоном. Она понимает видео длительностью более часа и способна локализовать события во времени. Модель поддерживает точную локализацию объектов с помощью ограничивающих рамок (bounding boxes) и ключевых точек, а также структурированный вывод в формате JSON для документов, счетов и таблиц. Флагманская модель Qwen2.5-VL-72B-Instruct показывает конкурентоспособные результаты на бенчмарках, включая задачи уровня колледжа, математику, понимание документов и видео. Меньшие версии (7B) превосходят GPT-4o-mini по ряду задач, а 3B, предназначенная для edge AI, превосходит предыдущую модель 7B. Также улучшено распознавание изображений: теперь модель охватывает огромное количество категорий, включая растения, животных, достопримечательности, персонажей фильмов и товары. Модель использует формат HTML для разметки документов (QwenVL HTML).
Fuente: Alibaba Qwen — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas