⚡ BREAKING
Qwen2.5 Omni: Näkee, kuulee, puhuu, kirjoittaa – kaikki yhdessä
Alibaba/Qwen
Alibaba Qwen on julkaissut Qwen2.5-Omni -lippulaivamultimodaalimallin, joka pystyy käsittelemään tekstiä, kuvia, ääntä ja videota sekä tuottamaan reaaliaikaista puhetta. Malli käyttää Thinker-Talker-arkkitehtuuria ja ylittää vastaavien mallien suorituskyvyn kaikissa modaliteeteissa.
Alibaba Qwen on julkaissut Qwen2.5-Omni -mallin, uuden lippulaivamallin Qwen-sarjassa, joka on suunniteltu kattavaan multimodaaliseen hahmottamiseen. Malli käsittelee tekstiä, kuvia, ääntä ja videota sekä tuottaa suoratoistovastauksia tekstinä tai luonnollisena puheena. Thinker-Talker-arkkitehtuuri sisältää Thinkerin, joka ymmärtää syötteen, ja Talkerin, joka tuottaa puhetta. Malli on saatavilla Hugging Facessa, ModelScopessa, DashScopessa ja GitHubissa. Qwen2.5-Omni suoriutuu äänitehtävissä paremmin kuin Qwen2.5-VL-7B ja Qwen2-Audio, on vertailukelpoinen video- ja kuvatehtävissä ja saavuttaa huipputulokset OmniBenchissä. Malli osoittaa myös korkeaa tarkkuutta puheentunnistuksessa, käännöksessä, äänen ymmärtämisessä ja puheentuotossa. Tulevaisuuden suunnitelmiin kuuluu äänikomentojen noudattamisen parantaminen ja useampien modaliteettien integrointi.
Lähde: Alibaba Qwen —
Alkuperäinen
