ArnésModelos 🇷🇺 01.08.2026 04:01

Cómo elegir un OCR en 2026: prueba de nueve modelos en tres motores de inferencia con escritura manuscrita rusa

PaddleOCR (Baidu)PaddleOCR (Baidu) DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
El artículo presenta un análisis comparativo de nueve modelos de OCR (tradicionales y VLM) en tres motores de inferencia (vLLM, SGLang, HF nativo) sobre escritura manuscrita rusa. Hallazgos clave: PaddleOCR-VL (1.7B) es más de cinco veces más rápido que Qwen2.5-VL-7B, la velocidad de Tesseract es engañosa debido a su baja completitud de salida, y HF nativo no es adecuado para producción. Se proporcionan recomendaciones para varios escenarios en una tabla.
El artículo del hub de Habr compara una gama de soluciones OCR para escritura manuscrita rusa, probando nueve modelos en los motores vLLM, SGLang y Native HF Transformers contra un conjunto de datos de textos manuscritos rusos. Los autores informan que Tesseract, a pesar de ser el más rápido con 193 páginas por minuto, devuelve solo 411 caracteres por página, mientras que PaddleOCR-VL produce 1193 tokens, lo que indica que una mayor velocidad a menudo significa contenido faltante. El especializado PaddleOCR-VL (1.7B) supera al Qwen2.5-VL-7B de propósito general en 5,2 veces en páginas por minuto y 6,7 veces en tokens por segundo. Native HF Transformers se queda detrás de vLLM y SGLang en dos veces para el mismo modelo debido a una menor utilización de la GPU. Los puntos de referencia muestran que para documentos impresos simples, Tesseract o RapidOCR basados en CPU son suficientes, mientras que para diseños complejos, tablas y salida Markdown, se recomienda PaddleOCR-VL con SGLang, y para producción con riesgos mínimos de compatibilidad, PaddleOCR-VL con vLLM. Para tareas de propósito general, Qwen2.5-VL-7B con vLLM es adecuado, y para VLM local del dominio ruso, se sugiere Cotype Light 3 con vLLM y MTP. Las pruebas se realizaron en una NVIDIA A100 80GB compartida con batch=1 y 15 muestras de escritura manuscrita rusa, con configuraciones unificadas como precisión bfloat16, temperatura 0.0 y avisos específicos.
Fuente: Habr — хаб ИИ — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas