AudioToText: Biến bản ghi cuộc họp thành công cụ quản lý yêu cầu
MLX Whisper
Bài viết giới thiệu AudioToText, một dự án cá nhân chuyển đổi bản ghi cuộc họp thành tài liệu có cấu trúc để quản lý yêu cầu. Dự án kết hợp nhận dạng giọng nói, phân tách người nói và xử lý ngôn ngữ tự nhiên để tạo ra bản tóm tắt theo cuộc họp, theo người nói và theo thực thể, giúp xác định các yêu cầu mâu thuẫn và lưu giữ lịch sử thảo luận.
Dự án AudioToText ra đời từ thực tiễn triển khai các dự án business intelligence (BI), nơi các chuyên gia phân tích phỏng vấn các bên liên quan của khách hàng và thu thập yêu cầu. Một vấn đề phổ biến là những người khác nhau có thể diễn đạt các yêu cầu mâu thuẫn cho cùng một thực thể, và nếu không có cách tiếp cận có cấu trúc, những mâu thuẫn này thường bị bỏ sót, dẫn đến tài liệu đặc tả kỹ thuật không nhất quán. AudioToText nhằm mục đích biến các bản ghi âm cuộc họp thành một tài liệu có cấu trúc có thể được xem xét, so sánh và sử dụng để thống nhất yêu cầu. Dự án sử dụng MLX Whisper để nhận dạng giọng nói, phân tách người nói, xử lý ngôn ngữ tự nhiên (NLP), và giao diện web Django để xem xét và xuất kết quả. Nó tạo ra các bản tóm tắt theo góc nhìn cuộc họp × người nói × thực thể, và hỗ trợ chú thích nhận dạng thực thể có tên (NER) thủ công để đánh giá chất lượng. Dự án được thiết kế để chạy cục bộ trên Apple Silicon nhằm giữ dữ liệu nhạy cảm tại chỗ. Kế hoạch tương lai bao gồm sử dụng PostgreSQL và pgvector để so sánh ngữ nghĩa các bản tóm tắt nhằm tự động phát hiện xung đột trong yêu cầu. Dự án cũng phân biệt người dùng, thành viên dự án và người nói, với mô hình kiểm soát truy cập dựa trên vai trò cho người xem, chuyên gia phân tích và quản lý dự án.
Nguồn: Habr — хаб ИИ —
bản gốc
