모델비즈니스 및 시장 🇺🇸 31.07.2026 09:02

PolyAI, Dialog-RSN-1 공개: 음성 기반 대화 모델로 응답 제어, 음성 인식, 함수 호출 및 응답 생성을 통합

PolyAIPolyAI OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen MistralMistral
PolyAI는 오디오를 직접 처리하는 음성 기반 대화 모델 Dialog-RSN-1을 출시했습니다. 이 모델은 응답 제어, 음성 인식, 함수 호출 및 응답 생성을 통합합니다. 이 모델은 이미 프로덕션 환경에서 사용 중이며, 300ms 미만의 응답 시간을 제공하고, 응답 유지율을 11%, 지연 시간을 37% 개선했습니다. PolyAI 플랫폼을 통해서만 사용할 수 있으며, 공개 가중치나 공개 API는 제공되지 않습니다.
PolyAI가 Dialog-RSN-1을 공개했습니다. 이 대화 모델은 필사본을 읽는 대신 발신자의 오디오를 직접 인식합니다. 이 모델은 응답 관리, 음성 인식, 함수 호출, 응답 생성 기능을 하나의 오디오 네이티브 모델에 통합했으며, 이미 실제 프로덕션 통화를 처리하고 있습니다. 모델 입력은 오디오이지만 TTS는 별도로 유지되어 음성을 제어할 수 있습니다. 모델은 상시 스트리밍이 아닌 요청 시에만 작동하므로 GPU를 계속 점유하지 않습니다. 첫 번째 출력 토큰은 EMPTY, ONGOING, COMPLETE 중 하나로 응답 여부를 결정합니다. PolyAI는 응답 시간이 300ms 미만이고, 레스토랑 그룹에서 발언 억제가 11% 상대적으로 개선되었으며, 보험사에서 지연 시간이 37% 감소했다고 보고했습니다. 모델은 영어로만 제공되며, PolyAI 플랫폼을 통해서만 액세스할 수 있고 공개 가중치나 공개 API는 없습니다. 아키텍처는 자체 데이터에 대한 지도 학습 및 강화 학습 파인튜닝을 통해 공개 가중치 멀티모달 모델을 사후 학습하는 방식입니다. PolyAI는 Gemma, GPT-OSS, Qwen, Mistral을 평가했습니다. 지연 시간 최적화에는 어텐션 캐시 사전 채우기, 접미사 프롬프트 템플릿, 각 발신자를 동일한 GPU에 라우팅, 평균 수용률 3.9 토큰의 추측 기반 초안 작성, RFT 중에 학습된 자동 추론 등이 포함됩니다. 필사는 음성 생성과 병렬로 마지막에 수행됩니다. PolyAI는 공개할 계획인 내부 벤치마크 Dialog-Eval에서 모델을 평가했습니다. 영어 외 언어의 경우 Raven 3.5가 권장됩니다. 기술 보고서와 Dialog-Eval 관련 논문이 예정되어 있습니다.
출처: MarkTechPost — 원문
관련 게시물 ↓
새로운 뉴스