モデルオープンソース 🇺🇸 27.07.2026 11:04

PP-OCRv6がHugging Faceで公開:1.5Mから34.5Mパラメータのモデルで50言語のテキスト認識

PaddleOCR (Baidu)PaddleOCR (Baidu)
PaddleOCRの汎用OCRモデルファミリーの最新世代であるPP-OCRv6が、Hugging Faceで利用可能になりました。3つのモデル階層(tiny、small、medium)があり、パラメータ数は1.5Mから34.5Mで、mediumとsmallは50言語をサポートします。検出と認識に改良が加えられ、検出Hmeanは最大86.2%、認識精度は83.2%に達しています。
PP-OCRv6は、PaddleOCRの汎用OCRモデルシリーズの最新世代であり、文書、スクリーンショット、多言語画像、デジタル表示、産業ラベル、およびシーン文字など実世界でのテキスト検出と認識向けに設計されています。パラメータ数は150万から3450万までの3段階(tiny、small、medium)を提供します。mediumおよびsmallバージョンは簡体字中国語、繁体字中国語、英語、日本語、および46のラテン文字言語を含む50言語に対応しています。PaddleOCRの公式ベンチマークでは、PP-OCRv6 mediumは検出Hmean 86.2%、認識精度83.2%を達成し、PP-OCRv5 serverをそれぞれ+4.6および+5.1ポイント上回っています。このモデルは統一バックボーンとしてPPLCNetV4を採用し、検出にはRepLKFPN、認識にはEncoderWithLightSVTRを使用しています。Paddle Inference、Transformers、ONNX Runtimeの複数のバックエンドで展開可能です。モデルはHugging Face Hubでsafetensors、Paddle推論、ONNX形式で提供されています。
出典: Hugging Face blog — 原文
関連記事 ↓
新着ニュース