AudioToText:会議録音を要件管理のツールに変える
MLX Whisper
この記事では、会議録音を要件管理のための構造化資料に変換するペットプロジェクト「AudioToText」を紹介します。音声認識、話者分離、NLP処理を組み合わせて、会議ごと、話者ごと、エンティティごとの要約を生成し、矛盾する要件の特定や議論の履歴の保存に役立てます。
プロジェクトAudioToTextは、BIプロジェクトの実装実務から生まれたもので、アナリストがクライアントのステークホルダーにインタビューを行い、要件を収集します。一般的な問題として、同じエンティティ(実体)に対して異なる人が矛盾する要件を述べることがあり、構造化されたアプローチがないと、これらの矛盾が見逃されがちで、一貫性のない技術仕様書につながります。AudioToTextは、会議の録音を、レビュー、比較、要件の整合に使用できる構造化された成果物に変換することを目的としています。このプロジェクトは、音声認識にMLX Whisper、話者ダイアライゼーション(話者分離)、NLP処理、レビューと結果のエクスポートのためのDjangoウェブインターフェースを使用しています。会議×話者×エンティティの観点で要約を生成し、品質評価のための手動NER(固有表現抽出)アノテーションをサポートしています。このプロジェクトは、機密データをオンプレミスに保つために、Apple Silicon上でローカルに実行するように設計されています。将来の計画には、PostgreSQLとpgvectorを使用して要約の意味的比較を行い、要件の矛盾を自動的に検出することが含まれています。また、このプロジェクトはユーザー、プロジェクトメンバー、スピーカーを区別し、閲覧者、アナリスト、プロジェクトマネージャー向けの役割ベースのアクセスモデルを備えています。
出典: Habr — хаб ИИ —
原文
