AudioToText: van vergaderopnamen tot hulpmiddel voor requirementsmanagement
MLX Whisper
Het artikel presenteert AudioToText, een hobbyproject dat vergaderopnamen omzet in gestructureerd materiaal voor het beheren van requirements. Het combineert spraakherkenning, sprekersdiarisering en natuurlijke taalverwerking om samenvattingen te genereren per vergadering, spreker en entiteit, wat helpt bij het identificeren van conflicterende requirements en het bewaren van de discussiegeschiedenis.
Het project AudioToText is ontstaan uit de praktijk van het implementeren van BI-projecten, waarbij analisten interviews afnemen met belanghebbenden van klanten en vereisten verzamelen. Een veelvoorkomend probleem is dat verschillende mensen tegenstrijdige vereisten kunnen uiten voor dezelfde entiteit, en zonder een gestructureerde aanpak worden deze tegenstrijdigheden vaak over het hoofd gezien, wat leidt tot inconsistente technische specificaties. AudioToText heeft als doel om vergaderopnamen om te zetten in een gestructureerd artefact dat kan worden beoordeeld, vergeleken en gebruikt voor het afstemmen van vereisten. Het project maakt gebruik van MLX Whisper voor spraakherkenning, sprekerdiarisatie, natuurlijke taalverwerking en een Django-webinterface voor het beoordelen en exporteren van resultaten. Het genereert samenvattingen in het perspectief vergadering × spreker × entiteit en ondersteunt handmatige naamgevingsentiteitsannotatie voor kwaliteitsevaluatie. Het project is ontworpen om lokaal op Apple Silicon te draaien om gevoelige gegevens on-premises te houden. Toekomstplannen omvatten het gebruik van PostgreSQL en pgvector voor semantische vergelijking van samenvattingen om automatisch conflicten in vereisten te detecteren. Het project maakt ook onderscheid tussen gebruikers, projectleden en sprekers, met een op rollen gebaseerd toegangsmodel voor viewers, analisten en projectmanagers.
Bron: Habr — хаб ИИ —
origineel
