ऑब्सीडियन सेमांटिक सर्च: वेक्टर डेटाबेस के बिना स्थानीय वेक्टर इंडेक्स कैसे काम करता है
OpenAI
Ollama
OpenRouter
यह लेख ऑब्सीडियन प्लगइन Vault Audit AI में सेमांटिक सर्च के कार्यान्वयन की व्याख्या करता है। लेखक बताता है कि मार्कडाउन नोट्स को वेक्टर में कैसे बदला जाता है, सिस्टम एक अलग वेक्टर डेटाबेस से क्यों बचता है, और इंक्रीमेंटल इंडेक्सिंग परिवर्तनों को कुशलतापूर्वक कैसे संभालती है।
Vault Audit AI के लेखक, जो एक Obsidian Community Plugin है, ने नोट लेने में फुल-टेक्स्ट सर्च की सीमाओं को दूर करने के लिए सिमेंटिक सर्च जोड़ा है। यह प्लगइन उपयोगकर्ताओं को केवल सटीक शब्द मिलान से ही नहीं, बल्कि अर्थ के आधार पर नोट्स खोजने की अनुमति देता है। इंडेक्स Obsidian वॉल्ट के अंदर संग्रहीत होता है, जिसके लिए किसी बाहरी वेक्टर डेटाबेस या सर्वर की आवश्यकता नहीं होती है। सिस्टम मार्कडाउन नोट्स को टुकड़ों में विभाजित करके, प्रत्येक टुकड़े को मॉडल के साथ एम्बेड करता है, और वेक्टर को एक कस्टम LocalVectorStore में संग्रहीत करता है। चंकर प्राकृतिक दस्तावेज़ सीमाओं जैसे शीर्षकों और सूचियों का सम्मान करता है, और हेडिंग पथ, सामग्री हैश, और स्रोत ऑफसेट जैसे मेटाडेटा बनाए रखता है। एम्बेडिंग प्रदाताओं में OpenRouter, OpenAI-संगत APIs (एप्लिकेशन प्रोग्रामिंग इंटरफेस), और Ollama शामिल हैं, जो सभी एक सामान्य इंटरफ़ेस के पीछे होते हैं। LocalVectorStore एक मैनिफ़ेस्ट और वेक्टर के लिए एक बाइनरी फ़ाइल का उपयोग करता है, जिसमें परमाणु लेखन स्थिरता सुनिश्चित करता है। वृद्धिशील इंडेक्सिंग मेटाडेटा और सामग्री हैश की तुलना करके अपरिवर्तित चंक्स के लिए एम्बेडिंग की पुनर्गणना से बचती है। लेखक घटकों को अलग करने के महत्व पर प्रकाश डालता है और अतुल्यकालिक दौड़ (एसिंक्रोनस रेस) के साथ चुनौतियों का उल्लेख करता है जो परीक्षण पास करने के बावजूद पकड़ी गईं।
स्रोत: Habr — хаб ИИ —
मूल
