PP-OCRv6 on Hugging Face: Text Recognition in 50 Languages with Models from 1.5M to 34.5M Parameters
PaddleOCR (Baidu)
The PaddleOCR team has released PP-OCRv6, a new family of universal OCR models supporting 50 languages. The models are available in three sizes (tiny, small, medium) with parameter counts ranging from 1.5M to 34.5M. Detection and recognition are significantly improved compared to the previous PP-OCRv5_server version.
PaddleOCR 팀이 PP-OCRv6를 발표했습니다. 이는 문서, 스크린샷, 다국어 이미지, 디지털 디스플레이, 산업용 라벨, 거리 텍스트 등 실제 환경에서 텍스트 탐지 및 인식을 위한 차세대 범용 OCR(광학 문자 인식) 모델입니다. 제품군에는 tiny(1.5M 파라미터), small(7.7M), medium(34.5M)의 세 가지 레벨이 있으며, medium과 small은 간체 및 번체 중국어, 영어, 일본어, 라틴어 기반 46개 언어를 포함한 50개 언어를 지원합니다. PaddleOCR 내부 벤치마크에서 PP-OCRv6_medium 모델은 탐지 Hmean(조화 평균) 86.2%, 인식 정확도 83.2%를 달성하여 각각 PP-OCRv5_server보다 4.6%p, 5.1%p 향상되었습니다. 탐지에는 RepLKFPN(큰 커널을 사용한 경량 피라미드 특징 네트워크)이 사용되었고, 인식에는 EncoderWithLightSVTR(국소 컨텍스트 모델링과 글로벌 어텐션을 결합)이 사용되었습니다. 개발자를 위해 Paddle Inference, Transformers(Hugging Face를 통해), ONNX Runtime 등 여러 추론 백엔드가 제공됩니다. Python 코드 예제는 다양한 백엔드로 OCR을 실행하는 방법을 보여줍니다. 모델은 safetensors, Paddle, ONNX 형식으로 Hugging Face Hub에 게시되었으며, 온라인 데모도 이용 가능합니다.
출처: Hugging Face blog —
원문
