अनुप्रयोग 🇷🇺 05.08.2026 23:02

ऑडियोटूटेक्स्ट: मीटिंग रिकॉर्डिंग को आवश्यकताओं के प्रबंधन के लिए एक उपकरण में बदलना

MLX WhisperMLX Whisper
यह लेख ऑडियोटूटेक्स्ट प्रस्तुत करता है, जो एक पेट प्रोजेक्ट है जो मीटिंग रिकॉर्डिंग को आवश्यकताओं के प्रबंधन के लिए संरचित सामग्री में परिवर्तित करता है। यह भाषण पहचान, वक्ता पृथक्करण, और एनएलपी प्रसंस्करण को मिलाकर प्रति मीटिंग, वक्ता और इकाई के अनुसार सारांश तैयार करता है, जिससे विरोधाभासी आवश्यकताओं की पहचान करने और चर्चा के इतिहास को संरक्षित करने में मदद मिलती है।
AudioToText परियोजना BI परियोजनाओं को लागू करने के अभ्यास से उत्पन्न हुई है, जहाँ विश्लेषक ग्राहकों के हितधारकों के साथ साक्षात्कार करते हैं और आवश्यकताओं को एकत्र करते हैं। एक सामान्य समस्या यह है कि अलग-अलग लोग एक ही इकाई के लिए विरोधाभासी आवश्यकताएँ व्यक्त कर सकते हैं, और संरचित दृष्टिकोण के बिना, ये विरोधाभास अक्सर छूट जाते हैं, जिससे असंगत तकनीकी विनिर्देश बनते हैं। AudioToText का उद्देश्य बैठक की रिकॉर्डिंग को एक संरचित कलाकृति (artifact) में बदलना है, जिसकी समीक्षा की जा सके, तुलना की जा सके, और आवश्यकताओं के संरेखण के लिए उपयोग किया जा सके। यह परियोजना वाक् पहचान के लिए MLX Whisper, वक्ता विभाजन (speaker diarization), NLP प्रसंस्करण, और समीक्षा एवं निर्यात के लिए Django वेब इंटरफ़ेस का उपयोग करती है। यह बैठक × वक्ता × इकाई परिप्रेक्ष्य में सारांश उत्पन्न करती है, और गुणवत्ता मूल्यांकन के लिए मैन्युअल NER एनोटेशन का समर्थन करती है। परियोजना संवेदनशील डेटा को ऑन-प्रिमाइसेस रखने के लिए Apple Silicon पर स्थानीय रूप से चलाने के लिए डिज़ाइन की गई है। भविष्य की योजनाओं में आवश्यकताओं में विरोधों का स्वचालित रूप से पता लगाने के लिए सारांशों की शब्दार्थ तुलना (semantic comparison) हेतु PostgreSQL और pgvector का उपयोग शामिल है। परियोजना उपयोगकर्ताओं, परियोजना सदस्यों, और वक्ताओं के बीच अंतर करती है, और दर्शकों, विश्लेषकों, और परियोजना प्रबंधकों के लिए भूमिका-आधारित एक्सेस मॉडल प्रदान करती है।
स्रोत: Habr — хаб ИИ — मूल
इस विषय पर हमारी पिछली पोस्ट ↓
ताज़ा समाचार