Aplicações 🇷🇺 05.08.2026 23:02

AudioToText: Transformando Gravações de Reuniões em uma Ferramenta para Gestão de Requisitos

MLX WhisperMLX Whisper
O artigo apresenta AudioToText, um projeto pessoal que converte gravações de reuniões em material estruturado para gerenciamento de requisitos. Ele combina reconhecimento de fala, diarização de locutores e processamento de linguagem natural (PLN) para gerar resumos por reunião, locutor e entidade, ajudando a identificar requisitos conflitantes e preservar o histórico de discussões.
O projeto AudioToText nasceu da prática de implementação de projetos de BI, onde analistas conduzem entrevistas com stakeholders clientes e coletam requisitos. Um problema comum é que diferentes pessoas podem expressar requisitos contraditórios para a mesma entidade e, sem uma abordagem estruturada, essas contradições são frequentemente perdidas, levando a especificações técnicas inconsistentes. O AudioToText visa transformar gravações de reuniões em um artefato estruturado que pode ser revisado, comparado e usado para o alinhamento de requisitos. O projeto utiliza MLX Whisper para reconhecimento de fala, diarização de locutores, processamento de linguagem natural (NLP) e uma interface web Django para revisão e exportação de resultados. Ele gera resumos na perspectiva reunião × locutor × entidade e suporta anotação manual de reconhecimento de entidades nomeadas (NER) para avaliação de qualidade. O projeto foi projetado para rodar localmente em Apple Silicon para manter dados sensíveis on-premises. Planos futuros incluem o uso de PostgreSQL e pgvector para comparação semântica de resumos, a fim de detectar automaticamente conflitos em requisitos. O projeto também distingue entre usuários, membros do projeto e locutores, com um modelo de acesso baseado em papéis para visualizadores, analistas e gerentes de projeto.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas