モデルビジネス・市場 🇺🇸 31.07.2026 09:02

PolyAIがDialog-RSN-1を発表:音声ネイティブな対話モデルが応答管理、音声認識、関数呼び出し、応答生成を統合

PolyAIPolyAI OpenAIOpenAI Google/DeepMindGoogle/DeepMind Alibaba/QwenAlibaba/Qwen MistralMistral
PolyAIは、音声ネイティブな対話モデルDialog-RSN-1を発表しました。このモデルは音声を直接処理し、応答管理、音声認識、関数呼び出し、応答生成を統合しています。モデルはすでに本番環境で使用されており、300ミリ秒未満で応答し、抑制率で11%、遅延で37%の改善を達成しています。PolyAIプラットフォーム経由でのみ利用可能で、オープンウェイトやパブリックAPIは提供されていません。
PolyAIは、コールの発信者の音声を直接認識し、文字起こしを読むのではなく、対話モデルDialog-RSN-1を発表しました。これは、応答管理、音声認識、関数呼び出し、応答生成を単一の音声ネイティブモデルに統合し、すでに本番環境のライブ通話を処理しています。モデルへの入力は音声ですが、テキスト読み上げ(TTS)は別個のままであり、音声を制御できます。モデルは常時ストリーミングではなくオンデマンドで動作し、GPUを常時負荷しません。最初の出力トークンは応答の決定であり、EMPTY、ONGOING、COMPLETEのいずれかです。PolyAIは、応答時間が300ミリ秒未満、レストラングループでの抑制の相対的な改善が11%、保険会社での遅延の削減が37%であると報告しています。モデルはPolyAIプラットフォーム経由でのみ利用でき、オープンな重みやパブリックAPIはなく、英語のみ対応です。アーキテクチャには、自社データを使用した監視付きおよび強化学習による微調整を用いた、オープンな重みのマルチモーダルモデルのポストトレーニングが含まれます。PolyAIは、Gemma、GPT-OSS、Qwen、Mistralを評価しました。遅延の最適化には、アテンションキャッシュのプリフィル、プロンプトテンプレートの追加、同じGPUへの各発信者のルーティング、平均受容率3.9トークンの投機的デコーディング、およびRFT中に学習された自動推論が含まれます。文字起こしは音声生成と並行して最後に行われます。PolyAIは、オープン化を計画している内部ベンチマークDialog-Evalでモデルを評価しました。英語以外の言語には、Raven 3.5が推奨されます。技術レポートとDialog-Evalに関する論文が予定されています。
出典: MarkTechPost — 原文
関連記事 ↓
新着ニュース