⚡ BREAKING
ModelGenerasi Media 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Melihat, Mendengar, Berbicara, Menulis – Semua dalam Satu

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen telah merilis Qwen2.5-Omni, model multimodal unggulan yang mampu memproses teks, gambar, audio, dan video, serta menghasilkan ucapan secara real-time. Model ini menggunakan arsitektur Thinker-Talker dan melampaui model serupa di seluruh modalitas.
Alibaba Qwen telah meluncurkan Qwen2.5-Omni, model andal baru dalam seri Qwen yang dirancang untuk persepsi multimodal yang komprehensif. Model ini memproses teks, gambar, audio, dan video, serta menghasilkan respons streaming dalam bentuk teks atau suara alami. Arsitektur Thinker-Talker mencakup Thinker yang memahami masukan dan Talker yang menghasilkan ucapan. Model ini tersedia di Hugging Face, ModelScope, DashScope, dan GitHub. Qwen2.5-Omni mengungguli Qwen2.5-VL-7B dan Qwen2-Audio dalam tugas audio, sebanding dalam video dan gambar, dan mencapai hasil mutakhir pada OmniBench. Model ini juga menunjukkan akurasi tinggi dalam pengenalan ucapan, penerjemahan, pemahaman audio, dan pembangkitan ucapan. Rencana ke depan termasuk meningkatkan kepatuhan terhadap perintah suara dan mengintegrasikan lebih banyak modalitas.
Sumber: Alibaba Qwen — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru