2026年のOCR選択ガイド:ロシア語手書き文字で3つの推論エンジンに対し9モデルをテスト
PaddleOCR (Baidu)
DeepSeek
Alibaba/Qwen
本記事では、ロシア語の手書き文字を対象に、3つの推論エンジン(vLLM、SGLang、Native HF)上で9つのOCRモデル(従来型およびVLM)をベンチマークした結果を紹介します。主な発見:PaddleOCR-VL(1.7B)はQwen2.5-VL-7Bより5倍以上高速である一方、Tesseractの速度は出力の完全性が低いために見かけ上のものであり、Native HFは本番環境に適していません。さまざまなシナリオに対する推奨事項が表にまとめられています。
HabrのAIハブの記事では、ロシア語手書き文字のための一連のOCRソリューションを比較し、9つのモデルをvLLM、SGLang、およびネイティブHF Transformersエンジン上で、ロシア語手書きテキストのデータセットに対してテストしています。著者らは、Tesseractは1分あたり193ページと最速であるにもかかわらず、1ページあたりわずか411文字しか返さないのに対し、PaddleOCR-VLは1193トークンを生成し、高速であるほどコンテンツが欠落することが多いことを示しています。専用のPaddleOCR-VL(1.7B)は、汎用のQwen2.5-VL-7Bを1分あたりのページ数で5.2倍、1秒あたりのトークン数で6.7倍上回っています。ネイティブHF Transformersは、同じモデルでもGPU利用率が低いため、vLLMやSGLangに2倍遅れを取ります。ベンチマークによると、単純な印刷文書にはCPUベースのTesseractやRapidOCRで十分ですが、複雑なレイアウト、テーブル、Markdown出力にはSGLangを備えたPaddleOCR-VLが推奨され、互換性リスクを最小限に抑えた本番環境ではvLLMを備えたPaddleOCR-VLが推奨されます。汎用タスクにはvLLMを備えたQwen2.5-VL-7Bが適しており、ローカルのRUドメインVLMにはvLLMとMTPを備えたCotype Light 3が提案されています。テストは共有NVIDIA A100 80GBで、バッチサイズ=1、15のロシア語手書きサンプルを使用して実施され、bfloat16精度、温度0.0、特定のプロンプト設定など統一された設定が使用されました。
出典: Habr — хаб ИИ —
原文
