Perinteiset OCR-tekstit saavat kielimallit oppimaan vain 30 prosentin tehokkuudella – FineBooks-projekti pyrkii muuttamaan tämän
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
Hugging Facen ja EleutherAI:n FineBooks-projekti testasi 14 avointa OCR-mallia yli 2 000 historiallisella kirjasivulla. Tulokset osoittavat, että pienemmät mallit ylittävät usein suuremmat kilpailijansa, ja paras malli saavuttaa yli 97 prosentin merkkitarkkuuden alle kahdella dollarilla tuhatta sivua kohden. Tekijöiden mukaan laatu riittää tekoälyn koulutukseen, mutta ei vielä tieteellisiin tarkoituksiin.
Hugging Face ja EleutherAI -projekti FineBooks testasi 14 avoimen lähdekoodin OCR-mallia 2 165 historiallisella kirjasivulla ja julkaisi tulokset johtotaulukkona. Motivaationa on, että kirjastojen OCR-tekstit ovat usein virheellisiä, ja tällaisella tekstillä koulutettu kielimalli oppii vain 30 prosentin tehokkuudella verrattuna ihmistranskriptioihin, kuten Talkie-projekti on määrittänyt. Johtava malli, dots.mocr, on kooltaan 3 miljardia parametria ja saavuttaa 97,6 prosentin tarkkuuden hintaan 1,94 dollaria tuhatta sivua kohti, kun taas OvisOCR2, jossa on vain 0,9 miljardia parametria, on toisella sijalla hintaan 0,46 dollaria tuhatta sivua kohti, mikä osoittaa, että mallin koko ja OCR-laatu eivät juuri korreloi historiallisten asiakirjojen kohdalla. Arviointi kattaa vain antikva-kirjaimistot englanniksi, ranskaksi, saksaksi ja latinaksi, ja se rajoittuu kirjamaisiin asiakirjoihin, joissa on yksipalstainen juokseva teksti. Seuraavana askeleena tiimi aikoo käsitellä uudelleen noin 200 000 julkisen domainin BHL-asiakirjaa jollakin johtavista malleista ja julkaista tekstin avoimena tietoaineistona. Vaikka mallit ovat riittävän hyviä tekoälykoulutukseen, ne korvaavat vanhanaikaisia merkkejä, kuten pitkän s:n, nykyaikaisilla vastineilla, mikä on ongelma tieteellisessä transkriptiossa; kohdennettu hienosäätö voisi korjata tämän kirjoittajien mukaan.
Lähde: The Decoder (DE) —
Alkuperäinen
