PP-OCRv6 sur Hugging Face : reconnaissance de texte en 50 langues avec des modèles de 1,5M à 34,5M de paramètres
PaddleOCR (Baidu)
PP-OCRv6, la dernière génération de la famille de modèles OCR universels de PaddleOCR, est désormais disponible sur Hugging Face. Il propose trois niveaux de modèles (tiny, small, medium) allant de 1,5M à 34,5M de paramètres, les niveaux medium et small prenant en charge 50 langues. Le modèle introduit des améliorations en détection et reconnaissance, atteignant jusqu'à 86,2% de Hmean en détection et 83,2% de précision en reconnaissance.
PP-OCRv6 est la dernière génération de la famille de modèles OCR universels de PaddleOCR, conçue pour la détection et la reconnaissance de texte dans des environnements réels tels que les documents, les captures d'écran, les images multilingues, les affichages numériques, les étiquettes industrielles et le texte de scène. Elle s'adapte de 1,5 million à 34,5 millions de paramètres avec trois niveaux : tiny, small et medium. Les niveaux medium et small prennent en charge 50 langues, y compris le chinois simplifié, le chinois traditionnel, l'anglais, le japonais et 46 langues à écriture latine. Sur les tests de référence officiels de PaddleOCR, le niveau medium de PP-OCRv6 atteint une précision de détection Hmean de 86,2 % et une précision de reconnaissance de 83,2 %, soit des améliorations respectives de +4,6 et +5,1 points de pourcentage par rapport au serveur PP-OCRv5. Le modèle utilise PPLCNetV4 comme backbone unifié, avec RepLKFPN pour la détection et EncoderWithLightSVTR pour la reconnaissance. Il peut être déployé avec plusieurs moteurs d'exécution : Paddle Inference, Transformers et ONNX Runtime. Les modèles sont disponibles sur le Hugging Face Hub aux formats safetensors, Paddle Inference et ONNX.
Source: Hugging Face blog —
original
