AudioToText: convierte las grabaciones de reuniones en una herramienta para la gestión de requisitos
MLX Whisper
El artículo presenta AudioToText, un proyecto personal que convierte las grabaciones de reuniones en material estructurado para la gestión de requisitos. Combina reconocimiento de voz, diarización de hablantes y procesamiento de lenguaje natural para generar resúmenes por reunión, hablante y entidad, lo que ayuda a identificar requisitos conflictivos y conservar el historial de discusiones.
El proyecto AudioToText nació de la práctica de implementar proyectos de BI, donde los analistas realizan entrevistas con las partes interesadas de los clientes y recopilan requisitos. Un problema común es que diferentes personas pueden expresar requisitos contradictorios para la misma entidad, y sin un enfoque estructurado, estas contradicciones a menudo se pasan por alto, lo que lleva a especificaciones técnicas inconsistentes. AudioToText tiene como objetivo convertir las grabaciones de reuniones en un artefacto estructurado que pueda revisarse, compararse y utilizarse para la alineación de requisitos. El proyecto utiliza MLX Whisper para el reconocimiento de voz, diarización de hablantes, procesamiento de lenguaje natural (NLP) y una interfaz web en Django para revisar y exportar resultados. Genera resúmenes en la perspectiva reunión × hablante × entidad, y admite anotación manual de entidades nombradas (NER) para la evaluación de calidad. El proyecto está diseñado para ejecutarse localmente en Apple Silicon para mantener los datos sensibles en las instalaciones. Los planes futuros incluyen el uso de PostgreSQL y pgvector para la comparación semántica de resúmenes y detectar automáticamente conflictos en los requisitos. El proyecto también distingue entre usuarios, miembros del proyecto y hablantes, con un modelo de acceso basado en roles para visualizadores, analistas y gerentes de proyecto.
Fuente: Habr — хаб ИИ —
original
