PP-OCRv6 हगिंग फेस पर: 50 भाषाओं में टेक्स्ट पहचान, 1.5M से 34.5M पैरामीटर वाले मॉडल
PaddleOCR (Baidu)
PP-OCRv6, PaddleOCR के सार्वभौमिक OCR मॉडल परिवार की नवीनतम पीढ़ी, अब हगिंग फेस पर उपलब्ध है। यह तीन मॉडल स्तर (टिनी, स्मॉल, मीडियम) प्रदान करता है, जिनमें पैरामीटर की संख्या 1.5M से 34.5M तक है, और मीडियम और स्मॉल स्तर 50 भाषाओं का समर्थन करते हैं। मॉडल में डिटेक्शन और रिकॉग्निशन में सुधार किया गया है, जिससे डिटेक्शन Hmean 86.2% और रिकॉग्निशन सटीकता 83.2% तक प्राप्त हुई है।
PP-OCRv6, PaddleOCR के सार्वभौमिक OCR मॉडल परिवार की नवीनतम पीढ़ी है, जिसे दस्तावेज़ों, स्क्रीनशॉट, बहुभाषी छवियों, डिजिटल डिस्प्ले, औद्योगिक लेबल और सीन टेक्स्ट में वास्तविक दुनिया के टेक्स्ट का पता लगाने और पहचानने के लिए डिज़ाइन किया गया है। यह तीन स्तरों - टिनी, स्मॉल और मीडियम - में 1.5M से 34.5M पैरामीटर तक फैला हुआ है। मीडियम और स्मॉल स्तर 50 भाषाओं का समर्थन करते हैं, जिनमें सरलीकृत चीनी, पारंपरिक चीनी, अंग्रेजी, जापानी और 46 लैटिन-लिपि वाली भाषाएँ शामिल हैं। PaddleOCR के आधिकारिक बेंचमार्क पर, PP-OCRv6 मीडियम 86.2% डिटेक्शन Hmean और 83.2% पहचान सटीकता प्राप्त करता है, जो PP-OCRv5 सर्वर से क्रमशः +4.6 और +5.1 प्रतिशत अंकों का सुधार है। मॉडल PPLCNetV4 को एकीकृत बैकबोन के रूप में उपयोग करता है, डिटेक्शन के लिए RepLKFPN और रिकॉग्निशन के लिए EncoderWithLightSVTR का उपयोग करता है। इसे एकाधिक बैकएंड - Paddle Inference, Transformers और ONNX Runtime - के साथ डिप्लॉय किया जा सकता है। मॉडल safetensors, Paddle inference और ONNX प्रारूपों में Hugging Face Hub पर उपलब्ध हैं।
स्रोत: Hugging Face blog —
मूल
