TrueConf AI秘書、困難な音響条件下で話者の音声分離を学習
TrueConfは、企業向けAI秘書の新バージョンをリリースしました。このバージョンでは、混合オーディオから話者の音声を分離し、正確な会議サマリーを生成できます。この機能は、サードパーティ製システムを含むあらゆるオーディオおよびビデオ録画で動作します。バージョン1.1では、文字起こしの横断検索とカスタマイズ可能なプロンプトも追加されています。
ロシアのIT企業TrueConfは、ビデオ会議参加者の音声を、混合音声を扱う場合でも最終サマリーで分離できる、新しいバージョンの法人向けAI秘書を発表した。この新技術により、他のコミュニケーションソリューションで作成されたものを含む、あらゆる音声・ビデオ録画からそのようなレポートを作成できる。以前、TrueConfはPCおよびスマートフォン向けアプリにスマート機能を統合していた。アクティブノイズリダクション、仮想背景、話者オーバーレイ、フェイスフォーカスなどである。2024年10月、同社はオンプレミス型AI秘書であるTrueConf AI Serverを導入した。これは、大量の文字起こしと会議サマリーを生成するためのもので、ローカルで動作し、データを第三者サーバーに送信しない。ビデオ会議の文字起こしにおける大きな課題は、各参加者が個別の音声ストリームを必要とすることである。参加者がオープンスペースにいる場合やマイクを共有する場合、アルゴリズムは音声を単一のブロックに混合してしまう。AI秘書は現在、音声を分離し、対応する発言をサマリーに割り当てることを学習している。ユーザーは検出された話者に名前を付けるだけでよい。需要は、大規模な会議を開催する石油・ガス部門のクライアント、国営企業、執行委員会から来ている。開発には約4か月かかった。この機能は、サードパーティ製システムからのものを含むあらゆる音声・ビデオファイルをサポートしており、TrueConf AI Serverを汎用的な文字起こしおよびサマリー作成ツールにしている。バージョン1.1では、文字起こし全体にわたる全文検索と、主要な決定事項、タスク、締め切り、構造化レポートなど、柔軟なサマリー作成のためのカスタマイズ可能なプロンプトも追加されている。TrueConf AI Serverは、社内のクローズドな顧客回路内でローカルモデルによって文字起こしが生成され、会社の従業員や管理者がアクセスできないことを保証する。
出典: CNews —
原文
