MallitLiiketoiminta ja markkinat 🇺🇸 31.07.2026 09:02

PolyAI esittelee Dialog-RSN-1:n: audio-natiivin keskustelumallin, joka yhdistää repliikkien hallinnan, puheentunnistuksen, funktiokutsut ja vastausten tuottamisen

PolyAIPolyAI OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen MistralMistral
PolyAI on julkaissut Dialog-RSN-1:n, audio-natiivin keskustelumallin, joka käsittelee ääntä suoraan yhdistäen repliikkien hallinnan, puheentunnistuksen, funktiokutsut ja vastausten tuottamisen. Malli on jo tuotantokäytössä, vastaten alle 300 millisekunnissa ja parantaen tuloksia 11 prosenttia pidäkkeessä ja 37 prosenttia viiveessä. Se on saatavilla vain PolyAI:n alustan kautta, ilman avoimia painoja tai julkista rajapintaa.
PolyAI on esitellyt Dialog-RSN-1:n, keskustelumallin, joka käsittelee soittajan ääntä suoraan eikä lue transkriptiota. Se yhdistää repliikkien hallinnan, puheentunnistuksen, funktiokutsut ja vastausten tuottamisen yhteen ääniympäristöön sovitettuun malliin ja käsittelee jo live-tuotantopuheluita. Mallin syöte on ääntä, mutta TTS (tekstistä puheeksi -muunnos) pysyy erillisenä, mikä mahdollistaa äänen hallinnan. Malli toimii pyynnöstä, ei jatkuvana virtana, eikä se kuormita GPU:ta jatkuvasti. Ensimmäinen lähtömerkki on repliikin päätös: EMPTY, ONGOING tai COMPLETE. PolyAI raportoi alle 300 millisekunnin vasteajan, 11 prosentin suhteellisen parannuksen pidäkkeessä ravintolaryhmässä ja 37 prosentin viiveen vähennyksen vakuutusyhtiöllä. Malli on saatavilla vain PolyAI:n alustan kautta, ilman avoimia painoja ja julkista rajapintaa, englannin kielellä. Arkkitehtuuri sisältää avoimien painojen multimodaalisten mallien jälkikoulutuksen käyttäen ohjattua ja vahvistusoppimiseen perustuvaa hienosäätöä omalla datalla. PolyAI on arvioinut Gemma-, GPT-OSS-, Qwen- ja Mistral-malleja. Viiveen optimointi sisältää huomion välimuistin esitäytön, kehote-mallin lisäyksellä, jokaisen soittajan reitityksen samalle GPU:lle, spekulatiivisen luonnoksen, jonka keskimääräinen hyväksyntä on 3,9 merkkiä, ja RFT:n aikana opitun itsepäättelyn. Transkriptio suoritetaan viimeisenä, rinnakkain puheen tuottamisen kanssa. PolyAI on arvioinut mallia sisäisellä Dialog-Eval-vertailuaineistolla, jonka se aikoo avata. Muille kuin englannin kielille suositellaan Raven 3.5 -mallia. Tekninen raportti ja artikkeli Dialog-Evalista ovat suunnitteilla.
Lähde: MarkTechPost — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset