PP-OCRv6 on Hugging Face: Text Recognition in 50 Languages with Models from 1.5M to 34.5M Parameters
PaddleOCR (Baidu)
The PaddleOCR team has released PP-OCRv6, a new family of universal OCR models supporting 50 languages. The models are available in three sizes (tiny, small, medium) with parameter counts ranging from 1.5M to 34.5M. Detection and recognition are significantly improved compared to the previous PP-OCRv5_server version.
Команда PaddleOCR представила PP-OCRv6 — новое поколение универсальных моделей оптического распознавания символов (Optical Character Recognition, OCR) для обнаружения и распознавания текста в реальных условиях: документы, скриншоты, многоязычные изображения, цифровые дисплеи, промышленные этикетки и уличные вывески. Семейство моделей включает три уровня — tiny (1,5 миллиона параметров), small (7,7 миллиона) и medium (34,5 миллиона), причём medium и small поддерживают 50 языков, включая упрощённый и традиционный китайский, английский, японский и 46 языков на основе латиницы. На внутренних бенчмарках PaddleOCR модель PP-OCRv6_medium достигает 86,2% Hmean детекции и 83,2% точности распознавания, что на 4,6 и 5,1 процентных пункта выше, чем у PP-OCRv5_server соответственно. В детекции используется RepLKFPN — лёгкая пирамида признаков с большими ядрами свёртки, а в распознавании — EncoderWithLightSVTR, сочетающий локальное моделирование контекста с глобальным вниманием. Для разработчиков доступны несколько бэкендов инференса: Paddle Inference, Transformers (через Hugging Face) и ONNX Runtime. Примеры кода на Python показывают, как запустить OCR с разными бэкендами. Модели опубликованы на Hugging Face Hub в форматах safetensors, Paddle и ONNX, также доступен онлайн-демонстратор.
Nguồn: Hugging Face blog —
bản gốc
