ResearchApplications 🇷🇺 31.07.2026 15:02

Как выбрать OCR в 2026-м: тестируем девять моделей на трех движках инференса на рукописном русском

PaddleOCR (Baidu)PaddleOCR (Baidu) DeepSeekDeepSeek
В статье сравниваются девять OCR-моделей на трех движках инференса для распознавания рукописного русского текста. Авторы представляют таблицу с результатами и рекомендациями по выбору модели в зависимости от задачи.
Пользователю, нуждающемуся в OCR, предлагается множество вариантов: от классического Tesseract до современных VLM, таких как PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL. Для инференса можно использовать vLLM, SGLang, TGI или Native HF Transformers. Авторы протестировали девять моделей на трех движках инференса на рукописном русском тексте и составили таблицу, показывающую, какая модель лучше подходит для конкретной задачи. Статья приглашает читателя ознакомиться с таблицей и историей ее создания.
Сокращения
OCR = Optical Character Recognition — оптическое распознавание символов
VLM = Vision Language Model — модель зрения и языка
SOTA = State Of The Art — передовой уровень
TGI = Text Generation Inference — инференс генерации текста
HF = Hugging Face — Hugging Face
Source: Habr — хаб ИИ — original
Our earlier posts on this topic ↓
Fresh news