PolyAI apresenta Dialog-RSN-1: modelo de diálogo nativo de áudio que integra gerenciamento de turnos, reconhecimento de fala, chamada de funções e geração de respostas
PolyAI
OpenAI
Google/DeepMind
Alibaba/Qwen
Mistral
A PolyAI lançou o Dialog-RSN-1, um modelo de diálogo nativo de áudio que processa áudio diretamente, integrando gerenciamento de turnos, reconhecimento de fala, chamada de funções e geração de respostas. O modelo já está em produção, fornecendo respostas em menos de 300 ms e melhorando as métricas em 11% em contenção e 37% em latência. Disponível apenas através da plataforma PolyAI, sem pesos abertos e API pública.
A PolyAI apresentou o Dialog-RSN-1, um modelo de diálogo que percebe o áudio do chamador diretamente, em vez de ler uma transcrição. Ele combina gerenciamento de turnos, reconhecimento de fala, chamada de funções e geração de respostas em um único modelo nativo de áudio e já está processando chamadas de produção ao vivo. A entrada do modelo é áudio, mas o TTS permanece separado, permitindo controle sobre a voz. O modelo opera sob demanda, não como um fluxo contínuo, evitando sobrecarga constante da GPU. O primeiro token de saída é a decisão de turno: EMPTY, ONGOING ou COMPLETE. A PolyAI relata tempo de resposta inferior a 300 ms, melhoria relativa de 11% na contenção em um grupo de restaurantes e redução de 37% na latência em uma seguradora. O modelo está disponível apenas através da plataforma PolyAI, sem pesos abertos ou API pública, em inglês. A arquitetura envolve pós-treinamento de modelos multimodais de pesos abertos usando ajuste fino supervisionado e com aprendizado por reforço em dados proprietários. A PolyAI avaliou Gemma, GPT-OSS, Qwen e Mistral. A otimização de latência inclui pré-preenchimento do cache de atenção, modelo de prompt com prefixo, roteamento de cada chamador para a mesma GPU, rascunho especulativo com aceitação média de 3.9 tokens e raciocínio automático aprendido durante o RFT. A transcrição é feita por último, em paralelo com a geração de fala. A PolyAI avaliou o modelo no benchmark interno Dialog-Eval, que planeja abrir. Para idiomas não ingleses, recomenda-se o Raven 3.5. Um relatório técnico e um artigo sobre o Dialog-Eval estão planejados.
Fonte: MarkTechPost —
original
