PP-OCRv6 Hugging Facessa: Tekstintunnistus 50 kielellä malleilla 1,5M–34,5M parametria
PaddleOCR (Baidu)
PP-OCRv6, PaddleOCR:n universaalin OCR-malliperheen uusin sukupolvi, on nyt saatavilla Hugging Facessa. Se tarjoaa kolme mallitasoa (tiny, small, medium), joiden parametrimäärä vaihtelee 1,5 miljoonasta 34,5 miljoonaan. Medium- ja small-tasot tukevat 50 kieltä. Malli tuo parannuksia tunnistukseen ja tekstintunnistukseen saavuttaen jopa 86,2 %:n tunnistuksen Hmean-arvon ja 83,2 %:n tekstintunnistuksen tarkkuuden.
PP-OCRv6 on PaddleOCR:n universaalin OCR-malliperheen uusin sukupolvi, joka on suunniteltu tekstin havaitsemiseen ja tunnistamiseen reaalimaailman kohteista, kuten asiakirjoista, kuvakaappauksista, monikielisistä kuvista, digitaalisista näytöistä, teollisuustarroista ja maisematekstistä. Se skaalautuu 1,5 miljoonasta 34,5 miljoonaan parametriin kolmella tasolla: tiny, small ja medium. Medium- ja small-tasot tukevat 50 kieltä, mukaan lukien yksinkertaistettu kiina, perinteinen kiina, englanti, japani ja 46 latinalaista kirjaimistoa käyttävää kieltä. PaddleOCR:n virallisissa vertailutesteissä PP-OCRv6 medium saavuttaa 86,2 prosentin havaitsemistarkkuuden (Hmean) ja 83,2 prosentin tunnistustarkkuuden, mikä on 4,6 ja 5,1 prosenttiyksikköä parempi kuin PP-OCRv5 Server -malli. Malli käyttää PPLCNetV4:tä yhtenäisenä runkona, RepLKFPN:ää havaitsemiseen ja EncoderWithLightSVTR:ää tunnistukseen. Se voidaan ottaa käyttöön useilla taustaohjelmistoilla: Paddle Inference, Transformers ja ONNX Runtime. Mallit ovat saatavilla Hugging Face Hubissa safetensors-, Paddle-inference- ja ONNX-muodoissa.
Lähde: Hugging Face blog —
Alkuperäinen
