Mô hìnhMã nguồn mở 🇨🇳 28.07.2026 16:03

Alibaba phát hành Qwen2.5-VL: mô hình đa phương thức hàng đầu mới

Alibaba/QwenAlibaba/Qwen
Alibaba giới thiệu Qwen2.5-VL — thế hệ mới của mô hình vision-language, có sẵn với các kích thước 3B, 7B và 72B. Mô hình nổi bật với khả năng hiểu hình ảnh được cải thiện, hỗ trợ video dài hơn một giờ, khả năng thực hiện các hành động tác nhân và đầu ra có cấu trúc.
Группа Qwen из Alibaba выпустила Qwen2.5-VL — новую флагманскую модель для зрения и языка. Она доступна в трёх размерах: 3B, 7B и 72B, как base, так и instruct версии, на Hugging Face и ModelScope. Модель может распознавать объекты, тексты, диаграммы, а также работать в качестве визуального агента: управлять компьютером или телефоном. Она понимает видео длительностью более часа и способна локализовать события во времени. Модель поддерживает точную локализацию объектов с помощью bounding boxes и ключевых точек, а также структурированный вывод в JSON для документов, счетов и таблиц. Флагман Qwen2.5-VL-72B-Instruct показывает конкурентоспособные результаты на бенчмарках, включая задачи уровня колледжа, математику, понимание документов и видео. Меньшие версии (7B) превосходят GPT-4o-mini по ряду задач, а 3B, предназначенная для edge AI, превосходит предыдущую 7B-модель. Также улучшено распознавание изображений: теперь модель охватывает огромное количество категорий, включая растения, животных, достопримечательности, персонажей фильмов и товары. Модель использует HTML-формат для разметки документов (QwenVL HTML).
Nguồn: Alibaba Qwen — bản gốc
Bài viết liên quan trước đây ↓
Tin mới