애플리케이션 🇷🇺 05.08.2026 23:02

AudioToText: 회의 녹음을 요구사항 관리 도구로 전환하기

MLX WhisperMLX Whisper
이 글은 회의 녹음을 요구사항 관리를 위한 구조화된 자료로 변환하는 개인 프로젝트인 AudioToText를 소개한다. 음성 인식, 화자 분리(diarization), 자연어처리(Natural Language Processing, NLP) 처리를 결합하여 회의별, 화자별, 개체별 요약을 생성하며, 이를 통해 상충되는 요구사항을 식별하고 논의 이력을 보존하는 데 도움을 준다.
AudioToText 프로젝트는 BI 프로젝트를 구현하는 실무에서 시작되었습니다. 여기서 분석가들은 클라이언트 이해관계자와 인터뷰를 수행하고 요구사항을 수집합니다. 흔한 문제는 서로 다른 사람들이 동일한 엔티티에 대해 상충되는 요구사항을 표현할 수 있다는 점인데, 구조화된 접근 방식이 없으면 이러한 모순이 종종 놓치게 되어 일관성이 없는 기술 명세서로 이어집니다. AudioToText는 회의 녹음을 검토, 비교 및 요구사항 정렬에 사용할 수 있는 구조화된 산출물로 전환하는 것을 목표로 합니다. 이 프로젝트는 음성 인식을 위해 MLX Whisper를 사용하고, 화자 분리, NLP 처리, 검토 및 결과 내보내기를 위한 Django 웹 인터페이스를 사용합니다. 회의 × 화자 × 엔티티 관점에서 요약을 생성하며, 품질 평가를 위한 수동 NER 주석을 지원합니다. 이 프로젝트는 민감한 데이터를 온프레미스에 유지하기 위해 Apple Silicon에서 로컬로 실행되도록 설계되었습니다. 향후 계획에는 요구사항의 충돌을 자동으로 감지하기 위해 요약의 의미론적 비교를 위한 PostgreSQL 및 pgvector 사용이 포함됩니다. 또한 이 프로젝트는 사용자, 프로젝트 멤버 및 화자를 구분하며, 뷰어, 분석가 및 프로젝트 관리자를 위한 역할 기반 액세스 모델을 제공합니다.
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스