MallitAvoin lähdekoodi 🇺🇸 27.07.2026 11:04

PP-OCRv6 Hugging Facessa: Tekstintunnistus 50 kielellä malleilla 1,5M–34,5M parametria

PaddleOCR (Baidu)PaddleOCR (Baidu)
PaddleOCR-tiimi on julkaissut PP-OCRv6:n, uuden universaalien OCR-mallien perheen, joka tukee 50 kieltä. Mallit ovat saatavilla kolmessa koossa (tiny, small, medium), joiden parametrimäärät vaihtelevat 1,5 miljoonasta 34,5 miljoonaan. Tunnistus ja tekstintunnistus ovat parantuneet merkittävästi aiempaan PP-OCRv5_server-versioon verrattuna.
PaddleOCR-tiimi on julkistanut PP-OCRv6:n, uuden sukupolven yleiskäyttöisiä OCR-malleja tekstin tunnistamiseen ja havaitsemiseen todellisissa olosuhteissa: asiakirjat, kuvakaappaukset, monikieliset kuvat, digitaaliset näytöt, teolliset tarrat ja katuteksti. Malliperheeseen kuuluu kolme tasoa: tiny (1,5 miljoonaa parametria), small (7,7 miljoonaa) ja medium (34,5 miljoonaa), joista medium ja small tukevat 50 kieltä, mukaan lukien yksinkertaistettu ja perinteinen kiina, englanti, japani ja 46 latinalaiseen kirjaimistoon perustuvaa kieltä. PaddleOCR:n sisäisissä vertailuarvoissa PP-OCRv6_medium saavuttaa 86,2 prosentin Hmean-tunnistustarkkuuden ja 83,2 prosentin tunnistustarkkuuden, mikä on 4,6 ja 5,1 prosenttiyksikköä enemmän kuin PP-OCRv5_serverillä. Tunnistuksessa käytetään RepLKFPN:ää, kevyttä piirrepyramidia suurilla konvoluutioytimillä, ja tunnistamisessa EncoderWithLightSVTR:ää, joka yhdistää paikallisen kontekstimallinnuksen globaaliin huomioon. Kehittäjille on tarjolla useita inferenssitaustajärjestelmiä: Paddle Inference, Transformers (Hugging Facen kautta) ja ONNX Runtime. Python-koodiesimerkit näyttävät, miten OCR käynnistetään eri taustajärjestelmillä. Mallit on julkaistu Hugging Face Hubissa safetensors-, Paddle- ja ONNX-muodoissa, ja myös online-demoversio on saatavilla.
Lähde: Hugging Face blog — Alkuperäinen
Aiemmat aiheeseen liittyvät kirjoituksemme ↓
Tuoreet uutiset