Open SourceOnderzoek 🇩🇪 10.08.2026 21:02

Legacy-OCR-teksten laten taalmodellen op slechts 30 procent efficiëntie leren – het FineBooks-project wil daar verandering in brengen

Hugging FaceHugging Face EleutherAIEleutherAI PaddleOCR (Baidu)PaddleOCR (Baidu) LightOnLightOn DeepSeekDeepSeek
Het FineBooks-project van Hugging Face en EleutherAI testte 14 open OCR-modellen op meer dan 2.000 pagina's uit historische boeken. De resultaten tonen aan dat kleinere modellen vaak beter presteren dan grotere concurrenten, waarbij het toonaangevende model meer dan 97 procent tekennauwkeurigheid behaalt voor minder dan 2 dollar per duizend pagina's. Volgens de auteurs is de kwaliteit voldoende voor AI-training, maar nog niet voor wetenschappelijke doeleinden.
Het FineBooks-project van Hugging Face en EleutherAI heeft 14 open-source OCR-modellen getest op 2.165 historische boekpagina's en de resultaten gepubliceerd als een leaderboard. De motivatie is dat OCR-teksten uit bibliotheken vaak gebreken vertonen, en dat een taalmodel dat op dergelijke teksten wordt getraind slechts 30% efficiëntie behaalt in vergelijking met menselijke transcripties, zoals gekwantificeerd door het Talkie-project. Het toonaangevende model, dots.mocr, heeft 3 miljard parameters en bereikt 97,6% nauwkeurigheid voor 1,94 dollar per duizend pagina's, terwijl OvisOCR2, met slechts 0,9 miljard parameters, op de tweede plaats staat voor 0,46 dollar per duizend pagina's, wat laat zien dat modelgrootte en OCR-kwaliteit nauwelijks correleren voor historische documenten. De evaluatie omvat alleen Antiqua-schrifttypen in het Engels, Frans, Duits en Latijn, en is beperkt tot boekachtige documenten met een enkelkolomse doorlopende tekst. Als volgende stap is het team van plan om ongeveer 200.000 publieke-domein BHL-documenten opnieuw te verwerken met een van de toonaangevende modellen en de tekst als een open dataset te publiceren. Hoewel de modellen goed genoeg zijn voor AI-training, vervangen ze archaïsche tekens zoals de lange s door moderne equivalenten, wat een probleem is voor wetenschappelijke transcriptie; gerichte fine-tuning zou dit volgens de auteurs kunnen verhelpen.
Bron: The Decoder (DE) — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws