Aplikasi 🇷🇺 05.08.2026 23:02

AudioToText: Mengubah Rekaman Rapat menjadi Alat untuk Manajemen Kebutuhan

MLX WhisperMLX Whisper
Artikel ini memperkenalkan AudioToText, sebuah proyek pribadi yang mengubah rekaman rapat menjadi materi terstruktur untuk mengelola kebutuhan. Proyek ini menggabungkan pengenalan suara, diarisasi pembicara, dan pemrosesan bahasa alami untuk menghasilkan ringkasan per rapat, per pembicara, dan per entitas, sehingga membantu mengidentifikasi kebutuhan yang bertentangan serta menjaga riwayat diskusi.
Proyek AudioToText lahir dari praktik implementasi proyek BI, di mana analis melakukan wawancara dengan pemangku kepentingan klien dan mengumpulkan kebutuhan. Masalah umumnya adalah bahwa orang yang berbeda dapat menyatakan kebutuhan yang saling bertentangan untuk entitas yang sama, dan tanpa pendekatan terstruktur, kontradiksi ini sering terlewatkan, yang mengarah pada spesifikasi teknis yang tidak konsisten. AudioToText bertujuan untuk mengubah rekaman rapat menjadi artefak terstruktur yang dapat ditinjau, dibandingkan, dan digunakan untuk penyelarasan kebutuhan. Proyek ini menggunakan MLX Whisper untuk pengenalan ucapan, diarisasi pembicara, pemrosesan NLP, dan antarmuka web Django untuk meninjau dan mengekspor hasil. Ini menghasilkan ringkasan dalam perspektif rapat × pembicara × entitas, dan mendukung anotasi NER manual untuk evaluasi kualitas. Proyek ini dirancang untuk berjalan secara lokal di Apple Silicon agar data sensitif tetap berada di lokasi. Rencana masa depan termasuk menggunakan PostgreSQL dan pgvector untuk perbandingan semantik ringkasan guna mendeteksi konflik dalam kebutuhan secara otomatis. Proyek ini juga membedakan antara pengguna, anggota proyek, dan pembicara, dengan model akses berbasis peran untuk penonton, analis, dan manajer proyek.
Sumber: Habr — хаб ИИ — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru