AudioToText:将会议录音转化为需求管理工具
MLX Whisper
本文介绍了一个名为 AudioToText 的个人项目,该项目将会议录音转换为用于需求管理的结构化材料。它结合了语音识别、说话人分离和自然语言处理(NLP)技术,生成按会议、发言人和实体划分的摘要,有助于识别冲突需求并保留讨论历史。
项目AudioToText源于实施BI项目的实践,在项目中分析师会与客户利益相关者进行访谈并收集需求。一个常见的问题是,不同的人可能对同一实体表达相互矛盾的需求,而如果没有结构化的方法,这些矛盾往往会被忽略,导致技术规范不一致。AudioToText旨在将会议录音转化为可审阅、可比较且可用于需求对齐的结构化产物。该项目使用MLX Whisper进行语音识别、说话人分离、NLP处理,并提供一个Django网页界面用于审阅和导出结果。它生成了会议×发言者×实体的视角摘要,并支持手动命名实体识别(NER)标注以进行质量评估。该项目设计为在Apple Silicon上本地运行,以确保敏感数据保留在本地。未来计划包括使用PostgreSQL和pgvector对摘要进行语义比较,以自动检测需求中的冲突。该项目还区分了用户、项目成员和发言者,并采用了针对查看者、分析师和项目经理的基于角色的访问模型。
来源: Habr — хаб ИИ —
原文
