MallitTutkimus 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Näkee, kuulee, puhuu, kirjoittaa – kaikki yhdessä

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen on julkaissut Qwen2.5-Omni -mallin, uuden lippulaivan multimodaalimallin, joka kykenee käsittelemään tekstiä, kuvia, ääntä ja videota sekä tuottamaan vastauksia tekstinä ja luonnollisena puheena reaaliajassa. Thinker-Talker -arkkitehtuuriin perustuva malli on avoimen lähdekoodin ja osoittaa korkeaa suorituskykyä kaikissa modaliteeteissa.
Alibaba Qwen on julkaissut Qwen2.5-Omni -nimisen päästä päähän -multimodaalimallin, joka vastaanottaa tekstiä, kuvia, ääntä ja videota ja tuottaa samanaikaisesti tekstiä ja luonnollista puhetta suoratoistotilassa. Mallin perustana on uusi Thinker-Talker -arkkitehtuuri, jossa Thinker (aivojen vastine) käsittelee eri modaliteettien syötteitä ja luo korkean tason esityksiä, ja Talker (suun vastine) tuottaa niiden perusteella puhetokeneita. Lisäksi käyttöön on otettu uusi TMRoPE (Time-aligned Multimodal RoPE) -paikoitusupotus, joka synkronoi video- ja äänen aikaleimat. Qwen2.5-Omni tukee täysin reaaliaikaista toimintaa, mukaan lukien lohkomainen syöte ja välitön tuloste. Puheentuotannon laadultaan malli ylittää monet olemassa olevat suoratoisto- ja ei-suoratoistovaihtoehdot. Vertailutesteissä Qwen2.5-Omni saavuttaa visiossa Qwen2.5-VL-7B:tä vastaavia tuloksia, ylittää Qwen2-Audion äänitehtävissä ja saavuttaa modaliteettien integraatiotehtävissä (OmniBench) huipputason. Malli on saatavilla Hugging Facessa, ModelScopessa, DashScopessa ja GitHubissa sekä Qwen Chatin ja demoversion kautta.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset