спецификациям. AudioToText стремится превратить записи встреч в структурированный артефакт, который можно просматривать, сравнивать и использовать для согласования требований. Проект использует MLX Whisper для распознавания речи, диаризацию говорящих, обработку естественного языка (NLP) и веб-интерфейс на Django для просмотра и экспорта результатов. Он генерирует сводки в разрезе встреча × говорящий × сущность и поддерживает ручную аннотацию NER для оценки качества. Проект предназначен для локального запуска на Apple Silicon, чтобы конфиденциальные данные оставались на месте. В будущих планах — использование PostgreSQL и pgvector для семантического сравнения сводок с целью автоматического обнаружения конфликтов в требованиях. Проект также различает пользователей, участников проекта и говорящих, с моделью доступа на основе ролей для зрителей, аналитиков и руководителей проектов.