PP-OCRv6 di Hugging Face: Pengenalan teks dalam 50 bahasa dengan model dari 1,5M hingga 34,5M parameter
PaddleOCR (Baidu)
PP-OCRv6, generasi terbaru dari keluarga model OCR universal PaddleOCR, kini tersedia di Hugging Face. Model ini menawarkan tiga tingkatan (tiny, small, medium) dengan rentang parameter 1,5M hingga 34,5M, di mana tingkatan medium dan small mendukung 50 bahasa. Model ini menghadirkan peningkatan dalam deteksi dan pengenalan, mencapai Hmean deteksi hingga 86,2% dan akurasi pengenalan 83,2%.
PP-OCRv6 adalah generasi terbaru dari keluarga model OCR universal PaddleOCR, yang dirancang untuk deteksi dan pengenalan teks di dunia nyata pada dokumen, tangkapan layar, gambar multibahasa, tampilan digital, label industri, dan teks pemandangan. Model ini memiliki skala parameter dari 1,5 juta hingga 34,5 juta dengan tiga tingkatan: tiny, small, dan medium. Tingkatan medium dan small mendukung 50 bahasa, termasuk bahasa Mandarin Sederhana, Mandarin Tradisional, Inggris, Jepang, dan 46 bahasa dengan aksara Latin. Pada tolok ukur resmi PaddleOCR, PP-OCRv6 medium mencapai Hmean deteksi 86,2% dan akurasi pengenalan 83,2%, meningkat masing-masing sebesar 4,6 dan 5,1 poin persentase dibandingkan server PP-OCRv5. Model ini menggunakan PPLCNetV4 sebagai backbone terpadu, dengan RepLKFPN untuk deteksi dan EncoderWithLightSVTR untuk pengenalan. Model dapat di-deploy dengan beberapa backend: Paddle Inference, Transformers, dan ONNX Runtime. Model tersedia di Hugging Face Hub dalam format safetensors, Paddle inference, dan ONNX.
Sumber: Hugging Face blog —
asli
