PP-OCRv6 on Hugging Face: Text Recognition in 50 Languages with Models from 1.5M to 34.5M Parameters
PaddleOCR (Baidu)
The PaddleOCR team has released PP-OCRv6, a new family of universal OCR models supporting 50 languages. The models are available in three sizes (tiny, small, medium) with parameter counts ranging from 1.5M to 34.5M. Detection and recognition are significantly improved compared to the previous PP-OCRv5_server version.
PaddleOCRチームは、PP-OCRv6を発表しました。これは、ドキュメント、スクリーンショット、多言語画像、デジタルディスプレイ、産業用ラベル、街中のテキストなど、実環境でのテキスト検出と認識のための新しい世代の汎用OCRモデルです。このファミリーは、tiny(1.5Mパラメータ)、small(7.7Mパラメータ)、medium(34.5Mパラメータ)の3つのレベルで構成されており、mediumとsmallは簡体字中国語と繁体字中国語、英語、日本語、およびラテンアルファベットベースの46言語を含む50言語をサポートしています。PaddleOCRの内部ベンチマークでは、PP-OCRv6_mediumモデルが検出Hmean 86.2%、認識精度83.2%を達成し、PP-OCRv5_serverと比較してそれぞれ4.6および5.1パーセントポイント向上しています。検出には、大規模な畳み込みカーネルを備えた軽量な特徴ピラミッドであるRepLKFPNが使用され、認識には、局所的なコンテキストモデリングと大域的な注意機構を組み合わせたEncoderWithLightSVTRが使用されています。開発者向けには、Paddle Inference、Transformers(Hugging Face経由)、ONNX Runtimeの複数の推論バックエンドが利用可能です。Pythonのコード例では、異なるバックエンドでOCRを実行する方法が示されています。モデルはHugging Face Hubでsafetensors、Paddle、ONNXの形式で公開されており、オンラインデモも利用可能です。
出典: Hugging Face blog —
原文
