Sovellukset 🇷🇺 05.08.2026 23:02

AudioToText: Kokousnauhoitteista työkalu vaatimustenhallintaan

MLX WhisperMLX Whisper
Artikkelissa esitellään AudioToText, harrasteprojekti, joka muuntaa kokousnauhoitteet strukturoiduksi materiaaliksi vaatimustenhallintaan. Se yhdistää puheentunnistuksen, puhujien erottelun (diarisaation) ja luonnollisen kielen käsittelyn (NLP) tuottaakseen yhteenvedot kokouksittain, puhujittain ja kokonaisuuksittain, mikä auttaa tunnistamaan ristiriitaiset vaatimukset ja säilyttämään keskusteluhistorian.
AudioToText-projekti sai alkunsa BI-projektien toteutuksen parista, jossa analyytikot haastattelevat asiakkaan sidosryhmiä ja keräävät vaatimuksia. Yleinen ongelma on, että eri ihmiset voivat ilmaista ristiriitaisia vaatimuksia samalle kokonaisuudelle, ja ilman jäsenneltyä lähestymistapaa nämä ristiriidat usein jäävät huomaamatta, mikä johtaa epäjohdonmukaisiin teknisiin määrittelyihin. AudioToText pyrkii muuttamaan kokousäänitteet jäsennellyksi artefaktiksi, jota voidaan tarkastella, vertailla ja käyttää vaatimusten yhdenmukaistamiseen. Projekti käyttää MLX Whisper -puheentunnistusta, puhujan erottelua, NLP-käsittelyä ja Django-verkkokäyttöliittymää tulosten tarkasteluun ja vientiin. Se tuottaa yhteenvedot kokous × puhuja × kokonaisuus -näkökulmasta ja tukee manuaalista NER-merkintää laadun arviointia varten. Projekti on suunniteltu toimimaan paikallisesti Apple Silicon -laitteilla, jotta arkaluonteiset tiedot pysyvät paikallisessa ympäristössä. Tulevaisuuden suunnitelmiin kuuluu PostgreSQL:n ja pgvectorin käyttö yhteenvetojen semanttiseen vertailuun, jotta vaatimusten ristiriidat voidaan havaita automaattisesti. Projekti erottaa myös käyttäjät, projektin jäsenet ja puhujat, ja siinä on roolipohjainen käyttöoikeusmalli katsojille, analyytikoille ja projektipäälliköille.
Lähde: Habr — хаб ИИ — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset