バイトダンス・ドウバオのデュプレックスモデルSeeduplexを深掘り
ByteDance
バイトダンス・ドウバオは、シンプレックスおよびデュプレックス音声モードをサポートする新しいモデルSeeduplexを公開しました。このモデルは、音声入力、並列認識、割り込み、および中国語と英語の混合を含む複数の言語の認識が可能です。Seeduplexは、命令的口調と優しい口調を組み合わせたハイブリッドスタイルを含む、さまざまな声やスタイルを模倣できます。
バイトダンスのDoubaoは、新しい二重音声モデル「Seeduplex」を発表した。このレビューでは、並列認識と割り込み、および他の音声を認識する能力が強調されている。このモデルは音声入力、単信および複信モードをサポートし、机を叩く音を含む音を同時に認識できる。Seeduplexは音声とスタイルを模倣でき(例えば、「力強い」語尾で命令調にする)、優しい声を模倣して微笑みのニュアンスを加えることもできる。リクエストに応じて男性声と女性声を切り替え、指示に従って口調を変えることができる。さらに、このモデルは中国語と英語の混在をサポートし、ほとんどの中国語のアクセント(例えば、一部の「北方」訛り)を認識し、様々なフォントの手書き文字を読み取ることができる。
出典: ByteDance Doubao (GNews) —
原文
