Hugging Face에서 공개된 PP-OCRv6: 1.5M~34.5M 매개변수 모델로 50개 언어 텍스트 인식
PaddleOCR (Baidu)
PaddleOCR의 최신 범용 OCR 모델 제품군인 PP-OCRv6가 Hugging Face에서 사용 가능해졌습니다. tiny, small, medium의 세 가지 모델 등급(1.5M~34.5M 매개변수)을 제공하며, medium과 small 등급은 50개 언어를 지원합니다. 이 모델은 탐지 및 인식 성능이 개선되어 최대 86.2%의 탐지 Hmean과 83.2%의 인식 정확도를 달성했습니다.
PP-OCRv6는 PaddleOCR의 범용 OCR 모델군 중 최신 세대로, 문서, 스크린샷, 다국어 이미지, 디지털 디스플레이, 산업용 라벨, 현장 텍스트 등 실제 환경에서의 텍스트 탐지 및 인식을 위해 설계되었습니다. 파라미터 규모는 1.5M부터 34.5M까지 세 가지 등급(tiny, small, medium)으로 제공됩니다. medium 및 small 등급은 중국어 간체, 중국어 번체, 영어, 일본어, 그리고 46개의 라틴 문자 언어를 포함한 50개 언어를 지원합니다. PaddleOCR의 공식 벤치마크에서 PP-OCRv6 medium은 탐지 Hmean 86.2%, 인식 정확도 83.2%를 달성하여 PP-OCRv5 서버 모델 대비 각각 +4.6%p 및 +5.1%p 향상되었습니다. 이 모델은 PPLCNetV4를 통합 백본으로 사용하며, 탐지에는 RepLKFPN, 인식에는 EncoderWithLightSVTR을 적용합니다. Paddle Inference, Transformers, ORT(ONNX Runtime) 등 여러 백엔드를 통해 배포할 수 있습니다. 모델은 Hugging Face Hub에서 safetensors, Paddle 추론, ONNX 형식으로 제공됩니다.
출처: Hugging Face blog —
원문
