PP-OCRv6 op Hugging Face: tekstherkenning in 50 talen met modellen van 1,5M tot 34,5M parameters
PaddleOCR (Baidu)
Het PaddleOCR-team heeft PP-OCRv6 uitgebracht, een nieuwe familie universele OCR-modellen die 50 talen ondersteunen. De modellen zijn beschikbaar in drie groottes (tiny, small, medium) met parameteraantallen variërend van 1,5M tot 34,5M. Detectie en herkenning zijn aanzienlijk verbeterd vergeleken met de vorige PP-OCRv5_server-versie.
Het PaddleOCR-team heeft PP-OCRv6 gepresenteerd, een nieuwe generatie universele OCR-modellen voor tekstherkenning en -detectie in realistische scenario's: documenten, schermafbeeldingen, meertalige afbeeldingen, digitale displays, industriële labels en straattekst. De familie omvat drie niveaus: tiny (1,5M parameters), small (7,7M) en medium (34,5M), waarbij medium en small 50 talen ondersteunen, waaronder vereenvoudigd en traditioneel Chinees, Engels, Japans en 46 talen op basis van het Latijnse schrift. Op interne benchmarks van PaddleOCR bereikt het model PP-OCRv6_medium een Hmean van 86,2% voor detectie en 83,2% voor herkenning, wat respectievelijk 4,6 en 5,1 procentpunt hoger is dan PP-OCRv5_server. Voor detectie wordt RepLKFPN gebruikt, een lichte kenmerkpiramide met grote convolutiekernen, en voor herkenning EncoderWithLightSVTR, dat lokale contextmodellering combineert met globale aandacht. Voor ontwikkelaars zijn meerdere inferentiebackends beschikbaar: Paddle Inference, Transformers (via Hugging Face) en ONNX Runtime. Python-codevoorbeelden tonen hoe OCR met verschillende backends kan worden uitgevoerd. De modellen zijn gepubliceerd op Hugging Face Hub in safetensors-, Paddle- en ONNX-formaten, en er is ook een online demo beschikbaar.
Bron: Hugging Face blog —
origineel
