⚡ TIN NÓNG
Mô hìnhSinh phương tiện 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Nhìn, Nghe, Nói, Viết – Tất Cả Trong Một

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen đã phát hành Qwen2.5-Omni, một mô hình đa phương thức hàng đầu có khả năng xử lý văn bản, hình ảnh, âm thanh và video, cũng như tạo ra giọng nói thời gian thực. Mô hình sử dụng kiến trúc Thinker-Talker và vượt trội hơn các mô hình tương tự trên tất cả các phương thức.
Alibaba Qwen đã công bố Qwen2.5-Omni, một mô hình chủ lực mới trong dòng Qwen được thiết kế cho nhận thức đa phương thức toàn diện. Mô hình này xử lý văn bản, hình ảnh, âm thanh và video, tạo ra các phản hồi dạng luồng dưới dạng văn bản hoặc giọng nói tự nhiên. Kiến trúc Thinker-Talker bao gồm một Thinker hiểu đầu vào và một Talker tạo ra giọng nói. Mô hình có sẵn trên Hugging Face, ModelScope, DashScope và GitHub. Qwen2.5-Omni vượt trội hơn Qwen2.5-VL-7B và Qwen2-Audio trong các tác vụ âm thanh, có hiệu suất tương đương trên video và hình ảnh, đồng thời đạt kết quả tiên tiến nhất trên OmniBench. Mô hình cũng thể hiện độ chính xác cao trong nhận dạng giọng nói, dịch thuật, hiểu âm thanh và tạo giọng nói. Các kế hoạch tương lai bao gồm cải thiện khả năng tuân thủ lệnh thoại và tích hợp thêm nhiều phương thức khác.
Nguồn: Alibaba Qwen — bản gốc
Bài viết liên quan trước đây ↓
Tin mới