⚡ BREAKING
MallitMediatuotanto 🇨🇳 28.07.2026 00:03

Qwen2.5 Omni: Näkee, kuulee, puhuu, kirjoittaa – kaikki yhdessä

Alibaba/QwenAlibaba/Qwen
Alibaba Qwen on julkaissut Qwen2.5-Omni -lippulaivamultimodaalimallin, joka pystyy käsittelemään tekstiä, kuvia, ääntä ja videota sekä tuottamaan reaaliaikaista puhetta. Malli käyttää Thinker-Talker-arkkitehtuuria ja ylittää vastaavien mallien suorituskyvyn kaikissa modaliteeteissa.
Alibaba Qwen on julkaissut Qwen2.5-Omni -mallin, uuden lippulaivamallin Qwen-sarjassa, joka on suunniteltu kattavaan multimodaaliseen hahmottamiseen. Malli käsittelee tekstiä, kuvia, ääntä ja videota sekä tuottaa suoratoistovastauksia tekstinä tai luonnollisena puheena. Thinker-Talker-arkkitehtuuri sisältää Thinkerin, joka ymmärtää syötteen, ja Talkerin, joka tuottaa puhetta. Malli on saatavilla Hugging Facessa, ModelScopessa, DashScopessa ja GitHubissa. Qwen2.5-Omni suoriutuu äänitehtävissä paremmin kuin Qwen2.5-VL-7B ja Qwen2-Audio, on vertailukelpoinen video- ja kuvatehtävissä ja saavuttaa huipputulokset OmniBenchissä. Malli osoittaa myös korkeaa tarkkuutta puheentunnistuksessa, käännöksessä, äänen ymmärtämisessä ja puheentuotossa. Tulevaisuuden suunnitelmiin kuuluu äänikomentojen noudattamisen parantaminen ja useampien modaliteettien integrointi.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset