Qwen2-VL: Alibaba phát hành thế hệ mới của mô hình thị giác-ngôn ngữ với hiệu suất SoTA
Alibaba/Qwen
Alibaba đã giới thiệu Qwen2-VL, thế hệ mới của mô hình thị giác-ngôn ngữ (vision-language), vượt trội so với phiên bản tiền nhiệm về khả năng hiểu hình ảnh, video và các tác vụ tác nhân đa phương thức. Các mô hình 2B và 7B được mở mã nguồn dưới giấy phép Apache 2.0, trong khi phiên bản 72B có sẵn qua API. Qwen2-VL-72B đạt hiệu suất vượt qua GPT-4o và Claude 3.5-Sonnet trên nhiều benchmark, đặc biệt là trong lĩnh vực hiểu tài liệu.
Alibaba đã phát hành Qwen2-VL, thế hệ mới của các mô hình ngôn ngữ-thị giác dựa trên Qwen2. Các mô hình 2B và 7B được mở mã nguồn dưới giấy phép Apache 2.0, trong khi phiên bản 72B có sẵn qua API. Qwen2-VL đạt kết quả state-of-the-art trên các benchmark MathVista, DocVQA, RealWorldQA, MTVQA. Mô hình có khả năng hiểu video dài hơn 20 phút và tích hợp với thiết bị để thực hiện các thao tác tự động. Hỗ trợ đa ngôn ngữ, bao gồm các ngôn ngữ châu Âu, tiếng Nhật, tiếng Hàn, tiếng Ả Rập, tiếng Việt. Qwen2-VL sử dụng Vision Transformer với 600 triệu tham số và hỗ trợ độ phân giải động. Đã giới thiệu phương pháp nhúng vị trí đa phương thức M-ROPE để nắm bắt đồng thời thông tin văn bản, hình ảnh và video. Mô hình thể hiện sự vượt trội trong việc hiểu tài liệu và giải quyết tác vụ, vượt qua GPT-4o và Claude 3.5-Sonnet. Hạn chế của mô hình: không trích xuất âm thanh từ video, kiến thức chỉ đến tháng 6 năm 2023, gặp khó khăn trong việc đếm và nhận diện ký tự.
Nguồn: Alibaba Qwen —
bản gốc
