NVIDIA、NemotronLabs VoiceChat 11Bを発表:オープンな全二重音声モデル、ターンテイキング450ミリ秒、ライブツール呼び出し対応
NVIDIA
NVIDIAは、NemotronLabs VoiceChat 11Bをリリースしました。これは、単一のネットワークでストリーミング音声理解と生成を行うオープンな全二重音声間モデルで、ターンテイキング遅延は448ミリ秒です。会話中にツール呼び出しをサポートする初のオープンな全二重モデルであり、サイドチャネルとオペレーター定義の保留メッセージを使用します。このモデルは研究パイロットプロジェクトのみに利用可能で、80GBのGPUが必要であり、ホスト型APIはまだありません。
NVIDIAは、リアルタイムの全二重対話向けのオープンな11Bエンドツーエンド音声対音声モデルであるNemotronLabs VoiceChat 11Bをリリースした。カスケードシステムとは異なり、このモデルは音声理解と生成を単一のネットワークに統合し、マルチモデルのオーケストレーションを排除し、Full-Duplex-Bench 1.0でのレイテンシを448ミリ秒に短縮する。このモデルは割り込み(barge-in)を可能にし、480ミリ秒での乗っ取り率は1.00である。また、オープンな全二重モデルとしては初めてツール呼び出しを実現し、<TOOLCALL>スクリプトを別チャネルで出力し、API実行中に無音を避けるためにオペレーター定義の保留音を使用する。このモデルは、Nemotron-Speech-Streaming-En-0.6b由来のFast Conformer音声エンコーダ、Nemotron Nano v2 LLMバックボーン、NVIDIA TTSデコーダを組み合わせており、約55万時間の音声で学習されている。ただし、研究目的のみであり、2分間の音声コンテキスト制限や数ターン後の性能低下など、文書化された失敗モードがある。80GBのGPU(例: A100、H100、RTX 6000 Pro、B200)が1つ必要で、ホスト型APIは提供されていない。制約として、セッションあたり最大5つのツール、システムプロンプトはASCIIのみである。性能スコアは、AU Harness BFCL-v3での単純なツール呼び出し58.5%、Full-Duplex-Bench v3でのツール選択82.5%である。このモデルは、VoiceBenchとFull-Duplex-Bench 1.0でオープンな全二重モデルの中で2位にランクされている。
出典: MarkTechPost —
原文
