Comment choisir un OCR en 2026 : Test de neuf modèles sur trois moteurs d'inférence avec des écritures manuscrites russes
PaddleOCR (Baidu)
DeepSeek
Alibaba/Qwen
Cet article présente un benchmark de neuf modèles OCR (traditionnels et VLM) sur trois moteurs d'inférence (vLLM, SGLang, HF natif) avec des écritures manuscrites russes. Principaux résultats : PaddleOCR-VL (1,7B) est plus de cinq fois plus rapide que Qwen2.5-VL-7B, la vitesse de Tesseract est trompeuse en raison de sa faible complétude de sortie, et HF natif ne convient pas à la production. Des recommandations pour divers scénarios sont fournies dans un tableau.
L'article du hub IA de Habr compare une gamme de solutions OCR pour l'écriture manuscrite en russe, en testant neuf modèles sur les moteurs vLLM, SGLang et Native HF Transformers, face à un ensemble de textes manuscrits russes. Les auteurs rapportent que Tesseract, bien qu'étant le plus rapide avec 193 pages par minute, ne restitue que 411 caractères par page, tandis que PaddleOCR-VL produit 1193 tokens, ce qui indique qu'une vitesse plus élevée signifie souvent du contenu manquant. Le modèle spécialisé PaddleOCR-VL (1,7B) surpasse le modèle généraliste Qwen2.5-VL-7B de 5,2 fois en pages par minute et de 6,7 fois en tokens par seconde. Les moteurs Native HF Transformers sont en retard de deux fois par rapport à vLLM et SGLang pour le même modèle, en raison d'une utilisation plus faible du GPU. Les benchmarks montrent que pour les documents imprimés simples, Tesseract ou RapidOCR sur CPU sont suffisants, tandis que pour les mises en page complexes, les tableaux et la sortie Markdown, PaddleOCR-VL avec SGLang est recommandé, et pour la production avec des risques de compatibilité minimaux, PaddleOCR-VL avec vLLM. Pour les tâches généralistes, Qwen2.5-VL-7B avec vLLM convient, et pour un VLM local dédié au domaine russe, Cotype Light 3 avec vLLM et MTP est suggéré. Les tests ont été menés sur un NVIDIA A100 80GB partagé avec batch=1 et 15 échantillons d'écriture manuscrite russe, avec des paramètres unifiés tels que la précision bfloat16, une température de 0,0 et un prompt spécifique.
Source: Habr — хаб ИИ —
original
