запросу, а не как постоянный поток, что не загружает GPU постоянно. Первым выходным токеном является решение о реплике: EMPTY, ONGOING или COMPLETE. PolyAI сообщает о времени ответа менее 300 мс, относительном улучшении сдерживания на 11% в ресторанной группе и снижении задержки на 37% у страховщика. Модель доступна только через платформу PolyAI, без открытых весов и публичного API, на английском языке. Архитектура включает пост-обучение открытых весовых мультимодальных моделей с использованием контролируемой и обучающейся с подкреплением точной настройки на собственных данных. PolyAI оценивала Gemma, GPT-OSS, Qwen и Mistral. Оптимизация задержки включает предварительное заполнение кэша внимания, шаблон промпта с добавлением, маршрутизацию каждого звонящего на тот же GPU, спекулятивный черновик со средним принятием 3.9 токенов и авто-рассуждение, изученное во время RFT. Транскрипция выполняется последней, параллельно с генерацией речи. PolyAI оценила модель на внутреннем бенчмарке Dialog-Eval, который планирует открыть. Для неанглийских языков рекомендуется Raven 3.5. Запланированы технический отчет и статья о Dialog-Eval.