PolyAI представляет Dialog-RSN-1: аудио-нативную диалоговую модель, объединяющую управление репликами, распознавание речи, вызов функций и генерацию ответов
PolyAI
OpenAI
Google/DeepMind
Alibaba/Qwen
Mistral
PolyAI выпустила Dialog-RSN-1, аудио-нативную диалоговую модель, которая обрабатывает аудио напрямую, объединяя управление репликами, распознавание речи, вызов функций и генерацию ответов. Модель уже используется в продакшене, обеспечивая ответы менее чем за 300 мс и улучшая показатели на 11% по сдерживанию и на 37% по задержке. Доступна только через платформу PolyAI, без открытых весов и публичного API.
PolyAI представила Dialog-RSN-1, диалоговую модель, которая воспринимает аудио звонящего напрямую, а не читает транскрипт. Она объединяет управление репликами, распознавание речи, вызов функций и генерацию ответов в одной аудио-нативной модели и уже обрабатывает живые производственные звонки. Вход модели — аудио, но TTS остается отдельным, что позволяет контролировать голос. Модель работает по запросу, а не как постоянный поток, что не загружает GPU постоянно. Первым выходным токеном является решение о реплике: EMPTY, ONGOING или COMPLETE. PolyAI сообщает о времени ответа менее 300 мс, относительном улучшении сдерживания на 11% в ресторанной группе и снижении задержки на 37% у страховщика. Модель доступна только через платформу PolyAI, без открытых весов и публичного API, на английском языке. Архитектура включает пост-обучение открытых весовых мультимодальных моделей с использованием контролируемой и обучающейся с подкреплением точной настройки на собственных данных. PolyAI оценивала Gemma, GPT-OSS, Qwen и Mistral. Оптимизация задержки включает предварительное заполнение кэша внимания, шаблон промпта с добавлением, маршрутизацию каждого звонящего на тот же GPU, спекулятивный черновик со средним принятием 3.9 токенов и авто-рассуждение, изученное во время RFT. Транскрипция выполняется последней, параллельно с генерацией речи. PolyAI оценила модель на внутреннем бенчмарке Dialog-Eval, который планирует открыть. Для неанглийских языков рекомендуется Raven 3.5. Запланированы технический отчет и статья о Dialog-Eval.
- Сокращения
- TTS = Text-to-Speech — синтез речи
- LLM = Large Language Model — большая языковая модель
- GPU = Graphics Processing Unit — графический процессор
- ASR = Automatic Speech Recognition — автоматическое распознавание речи
- VAD = Voice Activity Detection — обнаружение голосовой активности
- RFT = Reinforcement Fine-Tuning — обучение с подкреплением и точная настройка
- WER = Word Error Rate — частота ошибок в словах
- SMB = Small and Medium-sized Business — малый и средний бизнес
Source: MarkTechPost —
original
