ModellerAçık Kaynak 🇺🇸 27.07.2026 11:04

PP-OCRv6 on Hugging Face: Text Recognition in 50 Languages with Models from 1.5M to 34.5M Parameters

PaddleOCR (Baidu)PaddleOCR (Baidu)
The PaddleOCR team has released PP-OCRv6, a new family of universal OCR models supporting 50 languages. The models are available in three sizes (tiny, small, medium) with parameter counts ranging from 1.5M to 34.5M. Detection and recognition are significantly improved compared to the previous PP-OCRv5_server version.
PaddleOCR ekibi, gerçek dünya koşullarında metin algılama ve tanıma için yeni nesil evrensel OCR modelleri olan PP-OCRv6'yı tanıttı: belgeler, ekran görüntüleri, çok dilli görüntüler, dijital ekranlar, endüstriyel etiketler ve sokak metinleri. Aile, üç seviyeyi içeriyor: tiny (1,5 milyon parametre), small (7,7 milyon) ve medium (34,5 milyon); medium ve small, basitleştirilmiş ve geleneksel Çince, İngilizce, Japonca ve 46 Latin alfabesi tabanlı dil olmak üzere 50 dili destekliyor. Dahili PaddleOCR kıyaslamalarında PP-OCRv6_medium modeli, %86,2 Hmean algılama ve %83,2 tanıma doğruluğuna ulaşıyor; bu, PP-OCRv5_server'a göre sırasıyla 4,6 ve 5,1 yüzde puanı daha yüksek. Algılamada, büyık çekirdekli evrişimlere sahip hafif bir özellik piramidi olan RepLKFPN kullanılırken, tanımada yerel bağlam modellemesini küresel dikkatle birleştiren EncoderWithLightSVTR kullanılıyor. Geliştiriciler için birden çok çıkarım arka ucu mevcut: Paddle Inference, Transformers (Hugging Face aracılığıyla) ve ONNX Runtime. Python kod örnekleri, OCR'nin farklı arka uçlarla nasıl çalıştırılacağını gösteriyor. Modeller, safetensors, Paddle ve ONNX formatlarında Hugging Face Hub'da yayınlandı; ayrıca çevrimiçi bir demo da mevcut.
Kaynak: Hugging Face blog — orijinal
Bu konudaki önceki yazılarımız ↓
Güncel haberler