ModelosNegocios y Mercado 🇺🇸 31.07.2026 09:02

PolyAI presenta Dialog-RSN-1: un modelo de diálogo nativo de audio que integra gestión de turnos, reconocimiento de voz, llamada de funciones y generación de respuestas

PolyAIPolyAI OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen MistralMistral
PolyAI ha lanzado Dialog-RSN-1, un modelo de diálogo nativo de audio que procesa audio directamente, integrando gestión de turnos, reconocimiento de voz, llamada de funciones y generación de respuestas. El modelo ya se utiliza en producción, ofreciendo respuestas en menos de 300 ms y mejorando las métricas en un 11% en contención y un 37% en latencia. Solo está disponible a través de la plataforma de PolyAI, sin pesos abiertos ni API pública.
PolyAI ha presentado Dialog-RSN-1, un modelo conversacional que percibe directamente el audio de la persona que llama, en lugar de leer una transcripción. Combina la gestión de turnos, el reconocimiento del habla, la invocación de funciones y la generación de respuestas en un único modelo nativo de audio, y ya está gestionando llamadas de producción en vivo. La entrada del modelo es audio, pero la síntesis de voz (TTS) permanece separada, lo que permite controlar la voz. El modelo opera bajo demanda, no como un flujo constante, evitando así una carga continua de la GPU. El primer token de salida es la decisión de turno: EMPTY (vacío), ONGOING (en curso) o COMPLETE (completado). PolyAI informa de tiempos de respuesta inferiores a 300 ms, una mejora relativa del 11 % en la contención en un grupo de restaurantes y una reducción del 37 % en la latencia en una aseguradora. El modelo solo está disponible a través de la plataforma de PolyAI, sin pesos abiertos ni API pública, y únicamente en inglés. La arquitectura incluye el ajuste posterior de modelos multimodales de pesos abiertos mediante ajuste fino supervisado y aprendizaje por refuerzo con datos propios. PolyAI evaluó Gemma, GPT-OSS, Qwen y Mistral. La optimización de la latencia incluye la precarga de la caché de atención, una plantilla de instrucciones con adición, el enrutamiento de cada llamada al mismo GPU, un borrador especulativo con una aceptación media de 3.9 tokens y un razonamiento automático aprendido durante el ajuste por refuerzo (RFT). La transcripción se realiza al final, en paralelo con la generación del habla. PolyAI evaluó el modelo en su punto de referencia interno Dialog-Eval, que planea abrir. Para idiomas distintos del inglés, se recomienda Raven 3.5. Están previstos un informe técnico y un artículo sobre Dialog-Eval.
Fuente: MarkTechPost — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas