2026 में OCR कैसे चुनें: रूसी हस्तलेखन पर तीन इंफ़रेंस इंजनों में नौ मॉडलों का परीक्षण
PaddleOCR (Baidu)
DeepSeek
Alibaba/Qwen
यह लेख रूसी हस्तलेखन पर तीन इंफ़रेंस इंजनों (vLLM, SGLang, Native HF) में नौ OCR मॉडलों (पारंपरिक और VLM) का बेंचमार्क प्रस्तुत करता है। मुख्य निष्कर्ष: PaddleOCR-VL (1.7B) Qwen2.5-VL-7B की तुलना में पाँच गुना से अधिक तेज़ है, Tesseract की गति कम आउटपुट पूर्णता के कारण भ्रामक है, और Native HF उत्पादन के लिए अनुपयुक्त है। विभिन्न परिदृश्यों के लिए सिफारिशें एक तालिका में दी गई हैं।
हैबर की AI शाखा का लेख रूसी हस्तलेखन के लिए OCR समाधानों की एक श्रृंखला की तुलना करता है, जिसमें vLLM, SGLang और नेटिव HF Transformers इंजनों पर रूसी हस्तलिखित पाठों के डेटासेट के विरुद्ध नौ मॉडलों का परीक्षण किया गया है। लेखक रिपोर्ट करते हैं कि Tesseract, प्रति मिनट 193 पृष्ठों पर सबसे तेज़ होने के बावजूद, प्रति पृष्ठ केवल 411 वर्ण लौटाता है, जबकि PaddleOCR-VL 1193 टोकन देता है, जो दर्शाता है कि उच्च गति का मतलब अक्सर सामग्री का लुप्त होना है। विशेषीकृत PaddleOCR-VL (1.7B) सामान्य-उद्देश्य वाले Qwen2.5-VL-7B को प्रति मिनट पृष्ठों में 5.2 गुना और प्रति सेकंड टोकन में 6.7 गुना पीछे छोड़ देता है। नेटिव HF Transformers एक ही मॉडल के लिए vLLM और SGLang से दो गुना पीछे रह जाते हैं, क्योंकि GPU उपयोग कम होता है। बेंचमार्क दिखाते हैं कि सरल मुद्रित दस्तावेज़ों के लिए, CPU-आधारित Tesseract या RapidOCR पर्याप्त हैं, जबकि जटिल लेआउट, तालिकाओं और Markdown आउटपुट के लिए, SGLang के साथ PaddleOCR-VL की सिफारिश की जाती है, और न्यूनतम संगतता जोखिम वाले उत्पादन के लिए, vLLM के साथ PaddleOCR-VL। सामान्य-उद्देश्य कार्यों के लिए, vLLM के साथ Qwen2.5-VL-7B उपयुक्त है, और स्थानीय RU-डोमेन VLM के लिए, vLLM और MTP के साथ Cotype Light 3 सुझाया गया है। परीक्षण एक साझा NVIDIA A100 80GB पर batch=1 और 15 रूसी हस्तलेखन नमूनों के साथ किए गए थे, जिनमें bfloat16 परिशुद्धता, तापमान 0.0 और विशिष्ट प्रॉम्प्टिंग जैसी एकीकृत सेटिंग्स थीं।
स्रोत: Habr — хаб ИИ —
मूल
