PP-OCRv6 على Hugging Face: التعرف على النصوص بـ 50 لغة بموديلات من 1.5 مليون إلى 34.5 مليون معلمة
PaddleOCR (Baidu)
PP-OCRv6، أحدث إصدار من عائلة موديلات التعرف البصري على الأحرف (OCR) العامة من PaddleOCR، متوفر الآن على Hugging Face. يقدم ثلاث مستويات من الموديلات (صغير، متوسط، كبير) تتراوح من 1.5 مليون إلى 34.5 مليون معلمة، مع دعم المستويين المتوسط والكبير لـ 50 لغة. يحقق الموديل تحسينات في الكشف والتعرف، حيث تصل دقة الكشف (Hmean) إلى 86.2% ودقة التعرف إلى 83.2%.
PP-OCRv6 هو أحدث جيل من عائلة نماذج التعرف البصري الشاملة من PaddleOCR، مصمم لاكتشاف النص والتعرف عليه في التطبيقات الواقعية مثل المستندات، ولقطات الشاشة، والصور متعددة اللغات، والشاشات الرقمية، والملصقات الصناعية، والنصوص الميدانية. يتدرج حجمه من 1.5 مليون إلى 34.5 مليون معلمة عبر ثلاث فئات: صغير جدًا، صغير، ومتوسط. تدعم الفئتان المتوسطة والصغيرة 50 لغة بما في ذلك الصينية المبسطة، الصينية التقليدية، الإنجليزية، اليابانية، و46 لغة تستخدم الأبجدية اللاتينية. وفقًا لمعايير PaddleOCR الرسمية، يحقق نموذج PP-OCRv6 المتوسط دقة اكتشاف 86.2% ودقة تعرف 83.2%، متفوقًا على إصدار PP-OCRv5 السابق بنسبة 4.6 و5.1 نقطة مئوية على التوالي. يستخدم النموذج PPLCNetV4 كشبكة أساسية موحدة، مع RepLKFPN للاكتشاف وEncoderWithLightSVTR للتعرف. يمكن نشره باستخدام واجهات خلفية متعددة: Paddle Inference و Transformers و ONNX Runtime. النماذج متاحة على منصة Hugging Face Hub بتنسيقات safetensors و Paddle inference و ONNX.
المصدر: Hugging Face blog —
الأصلي
