PolyAI présente Dialog-RSN-1 : un modèle de dialogue audio-natif qui combine la gestion des tours de parole, la reconnaissance vocale, l'appel de fonctions et la génération de réponses
PolyAI
OpenAI
Google/DeepMind
Alibaba/Qwen
Mistral
PolyAI a publié Dialog-RSN-1, un modèle de dialogue audio-natif qui traite l'audio directement, en combinant la gestion des tours de parole, la reconnaissance vocale, l'appel de fonctions et la génération de réponses. Le modèle est déjà utilisé en production, fournissant des réponses en moins de 300 ms et améliorant les performances de 11 % sur la rétention et de 37 % sur la latence. Il n'est disponible que via la plateforme PolyAI, sans poids ouverts ni API publique.
PolyAI a dévoilé Dialog-RSN-1, un modèle conversationnel qui perçoit directement l'audio de l'appelant, plutôt que de lire une transcription. Il combine la gestion des tours de parole, la reconnaissance vocale, l'appel de fonctions et la génération de réponses dans un seul modèle natif audio, et il traite déjà des appels de production en direct. L'entrée du modèle est l'audio, mais la synthèse vocale (TTS) reste séparée, ce qui permet de contrôler la voix. Le modèle fonctionne à la demande, et non comme un flux continu, ce qui ne sollicite pas les GPU en permanence. Le premier jeton de sortie est la décision concernant le tour de parole : EMPTY, ONGOING ou COMPLETE. PolyAI fait état d'un temps de réponse inférieur à 300 millisecondes, d'une amélioration relative de 11 % dans la gestion des conversations pour un groupe de restaurants, et d'une réduction de 37 % de la latence chez un assureur. Le modèle n'est disponible que via la plateforme PolyAI, sans poids ouverts ni API publique, et uniquement en anglais. L'architecture comprend un post-entraînement de modèles multimodaux à poids ouverts, en utilisant un réglage fin supervisé et par apprentissage par renforcement sur des données propriétaires. PolyAI a évalué Gemma, GPT-OSS, Qwen et Mistral. L'optimisation de la latence inclut le pré-remplissage du cache d'attention, un modèle de prompt avec ajout, le routage de chaque appelant vers le même GPU, un brouillon spéculatif avec une acceptation moyenne de 3,9 jetons, et un raisonnement automatique appris lors du réglage fin par renforcement. La transcription est effectuée en dernier, en parallèle avec la génération de la parole. PolyAI a évalué le modèle sur son benchmark interne Dialog-Eval, qu'il prévoit d'ouvrir. Pour les langues non anglaises, Raven 3.5 est recommandé. Un rapport technique et un article sur Dialog-Eval sont prévus.
Source: MarkTechPost —
original
