AudioToText: Toplantı Kayıtlarını Gereksinim Yönetimi için Bir Araca Dönüştürmek
MLX Whisper
Makale, toplantı kayıtlarını gereksinim yönetimi için yapılandırılmış materyale dönüştüren bir hobi projesi olan AudioToText'i sunuyor. Konuşma tanıma, konuşmacı diyarizasyonu ve doğal dil işleme (NLP) işlemlerini birleştirerek toplantı, konuşmacı ve varlık başına özetler üretir; bu sayede çelişkili gereksinimlerin belirlenmesine ve tartışma geçmişinin korunmasına yardımcı olur.
AudioToText projesi, analistlerin müşteri paydaşlarıyla görüşmeler yaptığı ve gereksinimleri topladığı BI projelerinin uygulanması pratiğinden doğmuştur. Yaygın bir sorun, farklı kişilerin aynı varlık için çelişkili gereksinimler ifade edebilmesi ve yapılandırılmış bir yaklaşım olmadan bu çelişkilerin genellikle gözden kaçırılması ve tutarsız teknik şartnamelere yol açmasıdır. AudioToText, toplantı kayıtlarını incelenebilir, karşılaştırılabilir ve gereksinim uyumlaştırması için kullanılabilir yapılandırılmış bir yapıya dönüştürmeyi amaçlar. Proje, konuşma tanıma için MLX Whisper, konuşmacı diarizasyonu, doğal dil işleme (NLP) ve sonuçları incelemek ve dışa aktarmak için bir Django web arayüzü kullanır. Toplantı × konuşmacı × varlık perspektifinde özetler üretir ve kalite değerlendirmesi için manuel adlandırılmış varlık tanıma (NER) açıklamasını destekler. Proje, hassas verileri şirket içinde tutmak için Apple Silicon üzerinde yerel olarak çalışacak şekilde tasarlanmıştır. Gelecek planlar, gereksinimlerdeki çelişkileri otomatik olarak tespit etmek için özetlerin anlamsal karşılaştırması için PostgreSQL ve pgvector kullanmayı içerir. Proje ayrıca kullanıcılar, proje üyeleri ve konuşmacılar arasında ayrım yapar; görüntüleyenler, analistler ve proje yöneticileri için rol tabanlı bir erişim modeli sunar.
Kaynak: Habr — хаб ИИ —
orijinal
