Cách chọn OCR vào năm 2026: Thử nghiệm chín mô hình trên ba engine suy luận với chữ viết tay tiếng Nga
PaddleOCR (Baidu)
DeepSeek
Alibaba/Qwen
Bài viết trình bày một bài đánh giá chín mô hình OCR (truyền thống và VLM) trên ba engine suy luận (vLLM, SGLang, Native HF) với chữ viết tay tiếng Nga. Các phát hiện chính: PaddleOCR-VL (1.7B) nhanh hơn năm lần so với Qwen2.5-VL-7B, tốc độ của Tesseract gây hiểu lầm do độ hoàn thiện đầu ra thấp, và Native HF không phù hợp cho sản xuất. Các khuyến nghị cho các tình huống khác nhau được cung cấp trong một bảng.
Статья из AI-хаба Habr сравнивает ряд OCR-решений для распознавания русского рукописного текста, тестируя девять моделей на движках vLLM, SGLang и нативных HF Transformers на датасете русских рукописных текстов. Авторы сообщают, что Tesseract, несмотря на самую высокую скорость в 193 страницы в минуту, возвращает лишь 411 символов на страницу, тогда как PaddleOCR-VL выдает 1193 токена, что указывает на то, что более высокая скорость часто означает пропуск содержимого. Специализированная модель PaddleOCR-VL (1.7B) превосходит универсальную Qwen2.5-VL-7B в 5.2 раза по страницам в минуту и в 6.7 раза по токенам в секунду. Нативные HF Transformers отстают от vLLM и SGLang в два раза для одной и той же модели из-за более низкой загрузки GPU. Бенчмарки показывают, что для простых печатных документов достаточно Tesseract или RapidOCR на CPU, в то время как для сложных макетов, таблиц и вывода в Markdown рекомендуется PaddleOCR-VL с SGLang, а для продакшена с минимальными рисками совместимости — PaddleOCR-VL с vLLM. Для универсальных задач подходит Qwen2.5-VL-7B с vLLM, а для локальной VLM в русскоязычной домене предлагается Cotype Light 3 с vLLM и MTP. Тесты проводились на общей NVIDIA A100 80GB с batch=1 и 15 образцами русского рукописного текста, с едиными настройками, такими как точность bfloat16, температура 0.0 и конкретные промпты.
Nguồn: Habr — хаб ИИ —
bản gốc
