PolyAI introduceert Dialog-RSN-1: een audio-native dialoogmodel dat spraakherkenning, functieaanroep en antwoordgeneratie combineert
PolyAI
OpenAI
Google/DeepMind
Alibaba/Qwen
Mistral
PolyAI heeft Dialog-RSN-1 uitgebracht, een audio-native dialoogmodel dat audio direct verwerkt en spraakherkenning, functieaanroep en antwoordgeneratie combineert. Het model wordt al in productie gebruikt, met antwoorden in minder dan 300 milliseconden en verbeteringen van 11 procent op het gebied van terughoudendheid en 37 procent op het gebied van latentie. Het is alleen beschikbaar via het platform van PolyAI, zonder openbare gewichten of een publieke API.
PolyAI heeft Dialog-RSN-1 geïntroduceerd, een dialoogmodel dat de audio van de beller direct waarneemt in plaats van een transcript te lezen. Het combineert beurtmanagement, spraakherkenning, functieaanroepen en responsgeneratie in één audio-native model en verwerkt al live productiegesprekken. De invoer van het model is audio, maar TTS blijft apart, waardoor de stem gecontroleerd kan worden. Het model werkt op aanvraag, niet als een constante stream, waardoor de GPU niet continu wordt belast. De eerste outputtoken is de beurtbeslissing: EMPTY, ONGOING of COMPLETE. PolyAI rapporteert een responstijd van minder dan 300 milliseconden, een relatieve verbetering van 11% in terughoudendheid in een restaurantgroep en een latentievermindering van 37% bij een verzekeraar. Het model is alleen beschikbaar via het PolyAI-platform, zonder open gewichten of een openbare API, en is Engelstalig. De architectuur omvat post-training van open-weight multimodale modellen met behulp van supervised fine-tuning en reinforcement fine-tuning op eigen data. PolyAI evalueerde Gemma, GPT-OSS, Qwen en Mistral. De latentieoptimalisatie omvat het vooraf vullen van de attention cache, een prompttemplate met toevoegingen, het routeren van elke beller naar dezelfde GPU, een speculatieve draft met een gemiddelde acceptatie van 3,9 tokens en auto-reasoning dat is aangeleerd tijdens RFT. Transcriptie wordt als laatste uitgevoerd, parallel aan spraakgeneratie. PolyAI evalueerde het model op de eigen benchmark Dialog-Eval, die ze van plan zijn open te stellen. Voor niet-Engelse talen wordt Raven 3.5 aanbevolen. Er staan een technisch rapport en een artikel over Dialog-Eval gepland.
Bron: MarkTechPost —
origineel
