PolyAI представляет Dialog-RSN-1: аудио-нативную диалоговую модель, объединяющую управление репликами, распознавание речи, вызов функций и генерацию ответов
PolyAI выпустила Dialog-RSN-1, аудио-нативную диалоговую модель, которая обрабатывает аудио напрямую, объединяя управление репликами, распознавание речи, вызов функций и генерацию ответов. Модель уже используется в продакшене, обеспечивая ответы менее чем за 300 мс и улучшая показатели на 11% по сдерживанию и на 37% по задержке. Доступна только через платформу PolyAI, без открытых весов и публичного API.
PolyAI представила Dialog-RSN-1, диалоговую модель, которая воспринимает аудио звонящего напрямую, а не читает транскрипт. Она объединяет управление репликами, распознавание речи, вызов функций и генерацию ответов в одной аудио-нативной модели и уже обрабатывает живые производственные звонки. Вход модели — аудио, но TTS остается отдельным, что позволяет контролировать голос. Модель работает по
Показать ещё ↓
Источник: MarkTechPost —
оригинал
