PP-OCRv6 sur Hugging Face : Reconnaissance de texte en 50 langues avec des modèles de 1,5M à 34,5M de paramètres
PaddleOCR (Baidu)
L'équipe PaddleOCR a publié PP-OCRv6, une nouvelle famille de modèles OCR universels prenant en charge 50 langues. Les modèles sont disponibles en trois tailles (tiny, small, medium) avec un nombre de paramètres allant de 1,5M à 34,5M. La détection et la reconnaissance sont considérablement améliorées par rapport à la version précédente PP-OCRv5_server.
L'équipe PaddleOCR a dévoilé PP-OCRv6, une nouvelle génération de modèles OCR universels pour la détection et la reconnaissance de texte dans des conditions réelles : documents, captures d'écran, images multilingues, affichages numériques, étiquettes industrielles et textes de rue. La famille comprend trois niveaux — tiny (1,5 million de paramètres), small (7,7 millions) et medium (34,5 millions), les versions medium et small prenant en charge 50 langues, dont le chinois simplifié et traditionnel, l'anglais, le japonais et 46 langues à base latine. Sur les benchmarks internes de PaddleOCR, le modèle PP-OCRv6_medium atteint un Hmean de détection de 86,2 % et une précision de reconnaissance de 83,2 %, soit respectivement 4,6 et 5,1 points de pourcentage de plus que PP-OCRv5_server. En détection, RepLKFPN est utilisé — une pyramide de caractéristiques légère avec de grands noyaux de convolution — et en reconnaissance, EncoderWithLightSVTR combine modélisation locale du contexte et attention globale. Plusieurs moteurs d'inférence sont disponibles pour les développeurs : Paddle Inference, Transformers (via Hugging Face) et ONNX Runtime. Des exemples de code Python montrent comment exécuter l'OCR avec différents moteurs. Les modèles sont publiés sur le Hub Hugging Face aux formats safetensors, Paddle et ONNX, et une démo en ligne est également disponible.
Source: Hugging Face blog —
original
