하네스모델 🇷🇺 01.08.2026 04:01

2026년 OCR 선택 가이드: 러시아 필기체로 세 가지 추론 엔진에서 아홉 개 모델 테스트하기

PaddleOCR (Baidu)PaddleOCR (Baidu) DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
이 기사는 러시아 필기체에 대해 세 가지 추론 엔진(vLLM, SGLang, 네이티브 HF)에서 아홉 개의 OCR 모델(전통적 및 VLM)을 벤치마크한 결과를 제시합니다. 주요 발견 사항: PaddleOCR-VL(1.7B)은 Qwen2.5-VL-7B보다 5배 이상 빠르며, Tesseract의 속도는 출력 완전성이 낮아 착시 효과가 있고, 네이티브 HF는 프로덕션 환경에 적합하지 않습니다. 다양한 시나리오에 대한 권장 사항이 표로 제공됩니다.
Habr AI 板块的文章对比了一系列针对俄语手写体的 OCR 解决方案,在 vLLM、SGLang 和 Native HF Transformers 引擎上测试了九种模型,并使用俄语手写文本数据集进行评估。作者报告称,Tesseract 虽然速度最快,每分钟处理 193 页,但每页仅返回 411 个字符,而 PaddleOCR-VL 则产生 1193 个 token,这表明更高的速度往往意味着内容缺失。专用的 PaddleOCR-VL(1.7B)在每分钟页数和每秒 token 数上分别比通用型的 Qwen2.5-VL-7B 快 5.2 倍和 6.7 倍。对于同一模型,Native HF Transformers 因 GPU 利用率较低,比 vLLM 和 SGLang 慢两倍。基准测试显示,对于简单的印刷文档,基于 CPU 的 Tesseract 或 RapidOCR 就足够;对于复杂布局、表格和 Markdown 输出,推荐使用 PaddleOCR-VL 搭配 SGLang;对于生产环境中最小化兼容性风险的需求,则推荐 PaddleOCR-VL 搭配 vLLM。对于通用任务,Qwen2.5-VL-7B 搭配 vLLM 是合适的;对于本地俄语领域的视觉语言模型,建议使用 Cotype Light 3 搭配 vLLM 和 MTP。测试是在共享的 NVIDIA A100 80GB 上进行的,批处理大小设为 1,使用了 15 个俄语手写样本,并统一设置如 bfloat16 精度、温度为 0.0 以及特定的提示词。
출처: Habr — хаб ИИ — 원문
관련 게시물 ↓
새로운 뉴스