MallitAvoin lähdekoodi 🇨🇳 28.07.2026 19:03

Alibaba julkaisee Qwen2-Audion: uusi audio-kielimalli äänichatilla ja analyysillä

Alibaba/QwenAlibaba/Qwen
Alibaba esitteli Qwen2-Audion, uuden version audio-kielimallista, joka tukee äänichattia ilman ASR:ää, äänien, musiikin ja puheen analyysiä sekä yli 8 kieltä. Mallit Qwen2-Audio-7B ja Qwen2-Audio-7B-Instruct ovat avoimesti saatavilla Hugging Facessa ja ModelScopessa. Suorituskyky ylittää aiemmat SOTA-tulokset useilla vertailuarvoilla.
Alibaba on julkaissut Qwen2-Audion, seuraavan version Qwen-Audiosta, joka pystyy vastaanottamaan ääni- ja tekstitulosteita ja tuottamaan tekstiä. Käyttäjät voivat nyt ensimmäistä kertaa antaa äänikomentoja ilman ASR-moduuleja. Malli osaa analysoida ääni-informaatiota (puhe, äänet, musiikki) tekstiohjeiden perusteella ja tukee yli kahdeksaa kieltä, mukaan lukien kiina, englanti, kantoninkiina, ranska, italia, espanja, saksa ja japani. Qwen2-Audio-7B- ja Qwen2-Audio-7B-Instruct-mallien painot ovat avoimesti saatavilla Hugging Facessa ja ModelScopessa. Vertailuarvoissa, kuten LibriSpeech, Common Voice 15, Fleurs, Aishell2, CoVoST2, Meld, Vocalsound ja AIR-Benchmark, Qwen2-Audio ylittää selvästi aiemmat huipputulokset ja Qwen-Audion. Arkkitehtuuri perustuu Qwen-kielimalliin ja äänikoodaajaan, ja koulutus sisältää monitehtäväisen esikoulutuksen, ohjatun hienosäädön ja suoran preferenssioptimoinnin. Tulevaisuudessa on suunnitteilla koulutus suuremmilla tietoaineistoilla, tuki yli 30 sekunnin äänille ja suuremmat mallit.
Lähde: Alibaba Qwen — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset