PP-OCRv6 Hugging Face'te: 1.5M'den 34.5M parametreye kadar modellerle 50 dilde metin tanıma
PaddleOCR (Baidu)
PP-OCRv6, PaddleOCR'ın evrensel OCR model ailesinin en yeni nesli, artık Hugging Face'te mevcut. Üç model katmanı (tiny, small, medium) sunar: 1.5M ila 34.5M parametre arasında değişir; medium ve small katmanları 50 dili destekler. Model, algılama ve tanımada iyileştirmeler getirir; %86,2'ye varan algılama Hmean ve %83,2 tanıma doğruluğu elde eder.
PP-OCRv6, PaddleOCR'nin evrensel Optik Karakter Tanıma (OCR) model ailesinin en yeni neslidir; belgeler, ekran görüntüleri, çok dilli görüntüler, dijital ekranlar, endüstriyel etiketler ve sahne metinleri gibi gerçek dünya metin algılama ve tanıma işlemleri için tasarlanmıştır. 1,5 milyondan 34,5 milyon parametreye kadar üç kademede (küçük, orta ve büyük) ölçeklenebilir. Orta ve küçük kademeler, Basitleştirilmiş Çince, Geleneksel Çince, İngilizce, Japonca ve 46 Latin alfabesi dili dahil olmak üzere 50 dili destekler. PaddleOCR'nin resmi karşılaştırmalarında, PP-OCRv6 orta, %86,2 algılama Hmean ve %83,2 tanıma doğruluğu elde ederek, PP-OCRv5 sunucuya kıyasla sırasıyla +4,6 ve +5,1 yüzde puan iyileşme sağlar. Model, tek bir omurga olarak PPLCNetV4 kullanır; algılama için RepLKFPN ve tanıma için EncoderWithLightSVTR ile çalışır. Paddle Inference, Transformers ve ONNX Runtime gibi birden çok arka uçla dağıtılabilir. Modeller, Hugging Face Hub'da safetensors, Paddle inference ve ONNX formatlarında mevcuttur.
Kaynak: Hugging Face blog —
orijinal
