2026年如何选择OCR:在三个推理引擎上对九个模型进行俄语手写测试
PaddleOCR (Baidu)
DeepSeek
Alibaba/Qwen
本文对九个OCR模型(传统模型和视觉语言模型)在三个推理引擎(vLLM、SGLang、原生Hugging Face)上针对俄语手写进行了基准测试。主要发现:PaddleOCR-VL(1.7B)比Qwen2.5-VL-7B快五倍以上,Tesseract的速度因输出完整性低而具有误导性,原生Hugging Face不适合生产环境。文中还提供了针对各种场景的建议表格。
Habr AI 中心的文章比较了一系列针对俄语手写体的 OCR 解决方案,在 vLLM、SGLang 和原生 HF Transformers 引擎上测试了九个模型,数据集为俄语手写文本。作者报告称,Tesseract 虽然最快,每分钟处理 193 页,但每页仅返回 411 个字符,而 PaddleOCR-VL 则产出 1193 个令牌,这表明更高的速度往往意味着内容缺失。专用的 PaddleOCR-VL(1.7B)在每分钟页数和每秒令牌数方面分别比通用型的 Qwen2.5-VL-7B 快 5.2 倍和 6.7 倍。原生 HF Transformers 在相同模型下,由于 GPU 利用率较低,性能比 vLLM 和 SGLang 慢一倍。基准测试表明,对于简单的印刷文档,基于 CPU 的 Tesseract 或 RapidOCR 就足够了;对于复杂布局、表格和 Markdown 输出,推荐使用带 SGLang 的 PaddleOCR-VL;对于兼容性风险最小的生产环境,推荐使用带 vLLM 的 PaddleOCR-VL。对于通用任务,带 vLLM 的 Qwen2.5-VL-7B 适合;对于本地俄语领域视觉语言模型,建议使用带 vLLM 和 MTP 的 Cotype Light 3。测试是在共享的 NVIDIA A100 80GB 上进行的,batch=1,使用 15 个俄语手写样本,统一设置包括 bfloat16 精度、温度 0.0 和特定提示词。
来源: Habr — хаб ИИ —
原文
