प्रति सेकंड 2000 पहचान: न्यूरल नेटवर्क के बिना दस्तावेज़ पर सही तालिका का चयन कैसे करें
Smart Engines
Meta
स्मार्ट इंजन ने न्यूरल नेटवर्क के बजाय नियमित अभिव्यक्तियों का उपयोग करके किसी दस्तावेज़ पर कई तालिका-समान क्षेत्रों में से लक्ष्य तालिका की पहचान करने की एक विधि विकसित की है। प्रत्येक तालिका क्षेत्र को एक-आयामी स्ट्रिंग में परिवर्तित किया जाता है जो उसकी संरचना और पाठ सामग्री को एनकोड करता है, जिसे फिर regex पैटर्न के विरुद्ध मिलान किया जाता है। यह दृष्टिकोण मोबाइल प्रोसेसर पर प्रति सेकंड लगभग 2000 पहचान चलाता है और वास्तविक दस्तावेज़ों पर मान्यता गुणवत्ता में सुधार करता है।
Smart Engines ने न्यूरल नेटवर्क का उपयोग किए बिना किसी दस्तावेज़ पर कई टेबल-जैसे क्षेत्रों में से सही टेबल की पहचान करने की एक विधि विकसित की है। यह सिस्टम पहले संभावित टेबल क्षेत्रों का पता लगाता है, फिर प्रत्येक क्षेत्र को एक-आयामी स्ट्रिंग में परिवर्तित करता है जो इसकी ज्यामितीय संरचना और पाठ्य सामग्री दोनों को एन्कोड करता है। यह ऊर्ध्वाधर रेखाओं और ऑप्टिकल कैरेक्टर रिकग्निशन शब्दों को एक्स-अक्ष पर प्रक्षेपित करके किया जाता है, स्थितियों को रेखा गुणवत्ता अंक, पाठ मार्कर, या खाली बिंदुओं के रूप में चिह्नित करके और उन्हें एक संक्षिप्त हस्ताक्षर में विलीन करके। पहचान कार्य तब इस स्ट्रिंग को नियमित अभिव्यक्तियों के विरुद्ध जाँचने तक सीमित हो जाता है जो अपेक्षित टेबल संरचना का वर्णन करते हैं। दो परिदृश्य उपयोग किए जाते हैं: इनवॉइस जैसे मानकीकृत रूपों के लिए निश्चित संरचना पहचान, और उन टेबलों के लिए विशेषता स्तंभ पहचान जहां स्तंभ क्रम भिन्न हो सकता है। रूसी दस्तावेजों (अधिनियमों और इनवॉइस) पर परीक्षणों से पंक्ति और स्तंभ पहचान त्रुटियों में क्रमशः 35.87% और 26.36% तक की कमी देखी गई, जिसमें सेल पहचान सटीकता में 9.97% तक सुधार हुआ। यह एल्गोरिदम एआरएमवी8 64-बिट पर प्रति क्षेत्र 0.49 मिलीसेकंड में चलता है, जो प्रति सेकंड लगभग 2000 जाँचें हैं, जबकि पीसी पर लामा 3 के साथ एलएलएम दृष्टिकोण का उपयोग करके प्रति उम्मीदवार 1-3 सेकंड की तुलना में। यह विधि टेबल संरचना के आधार पर दस्तावेज़ प्रकारों को वर्गीकृत करने के लिए भी लागू की गई थी, जिसमें सात प्रकारों में से पांच के लिए 100% परिशुद्धता और रिकॉल प्राप्त हुआ, जो आधारभूत क्षेत्र-आधारित वर्गीकरण से बेहतर प्रदर्शन करता है।
स्रोत: Habr — хаб ML —
मूल
