PP-OCRv6 on Hugging Face: Text Recognition in 50 Languages with Models from 1.5M to 34.5M Parameters
PaddleOCR (Baidu)
The PaddleOCR team has released PP-OCRv6, a new family of universal OCR models supporting 50 languages. The models are available in three sizes (tiny, small, medium) with parameter counts ranging from 1.5M to 34.5M. Detection and recognition are significantly improved compared to the previous PP-OCRv5_server version.
Tim PaddleOCR telah merilis PP-OCRv6 — generasi baru model OCR serbaguna untuk deteksi dan pengenalan teks dalam skenario dunia nyata: dokumen, tangkapan layar, gambar multibahasa, tampilan digital, label industri, dan teks jalanan. Keluarga model ini mencakup tiga tingkatan—tiny (1,5 juta parameter), small (7,7 juta), dan medium (34,5 juta), di mana medium dan small mendukung 50 bahasa, termasuk bahasa Tionghoa Sederhana dan Tradisional, Inggris, Jepang, serta 46 bahasa berbasis aksara Latin. Pada tolok ukur internal PaddleOCR, model PP-OCRv6_medium mencapai 86,2% Hmean deteksi dan 83,2% akurasi pengenalan, lebih tinggi masing-masing 4,6 dan 5,1 poin persentase dibandingkan PP-OCRv5_server. Untuk deteksi, digunakan RepLKFPN—piramida fitur ringan dengan kernel konvolusi besar—sementara untuk pengenalan, digunakan EncoderWithLightSVTR yang menggabungkan pemodelan konteks lokal dengan perhatian global. Pengembang dapat memilih beberapa backend inferensi: Paddle Inference, Transformers (melalui Hugging Face), dan ONNX Runtime. Contoh kode Python menunjukkan cara menjalankan OCR dengan backend yang berbeda. Model telah dipublikasikan di Hugging Face Hub dalam format safetensors, Paddle, dan ONNX, serta tersedia demo daring.
Sumber: Hugging Face blog —
asli
