EstruturasModelos 🇷🇺 01.08.2026 04:01

Como escolher um OCR em 2026: testando nove modelos em três mecanismos de inferência em escrita manual russa

PaddleOCR (Baidu)PaddleOCR (Baidu) DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
O artigo apresenta um benchmark de nove modelos de OCR (tradicionais e VLM) em três mecanismos de inferência (vLLM, SGLang, Native HF) em escrita manual russa. Principais descobertas: PaddleOCR-VL (1.7B) é mais de cinco vezes mais rápido que Qwen2.5-VL-7B, a velocidade do Tesseract é enganosa devido à baixa completude de saída, e o Native HF não é adequado para produção. Recomendações para vários cenários são fornecidas em uma tabela.
O artigo do hub de IA do Habr compara uma variedade de soluções de OCR para escrita manual russa, testando nove modelos em engines vLLM, SGLang e Native HF Transformers contra um conjunto de dados de textos manuscritos russos. Os autores relatam que o Tesseract, apesar de ser o mais rápido com 193 páginas por minuto, retorna apenas 411 caracteres por página, enquanto o PaddleOCR-VL produz 1193 tokens, indicando que maior velocidade muitas vezes significa conteúdo ausente. O especializado PaddleOCR-VL (1.7B) supera o Qwen2.5-VL-7B de propósito geral em 5,2 vezes em páginas por minuto e 6,7 vezes em tokens por segundo. Os HF Transformers nativos ficam atrás do vLLM e do SGLang por duas vezes para o mesmo modelo devido à menor utilização da GPU. Os benchmarks mostram que, para documentos impressos simples, o Tesseract baseado em CPU ou o RapidOCR são suficientes, enquanto para layouts complexos, tabelas e saída em Markdown, o PaddleOCR-VL com SGLang é recomendado, e para produção com riscos mínimos de compatibilidade, o PaddleOCR-VL com vLLM. Para tarefas de propósito geral, o Qwen2.5-VL-7B com vLLM é adequado, e para VLM local no domínio RU, o Cotype Light 3 com vLLM e MTP é sugerido. Os testes foram conduzidos em um NVIDIA A100 80GB compartilhado com batch=1 e 15 amostras de escrita manual russa, com configurações unificadas como precisão bfloat16, temperatura 0.0 e prompting específico.
Fonte: Habr — хаб ИИ — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas