Les textes OCR hérités ne permettent aux modèles de langue d'apprendre qu'à 30 pour cent d'efficacité – le projet FineBooks vise à changer cela
Le projet FineBooks de Hugging Face et EleutherAI a testé 14 modèles OCR open source sur plus de 2 000 pages de livres historiques. Les résultats montrent que les modèles plus petits surpassent souvent les concurrents plus grands, le meilleur modèle atteignant plus de 97 pour cent de précision sur les caractères pour moins de 2 dollars par millier de pages. Selon les auteurs, la qualité est suffisante pour l'entraînement de l'IA, mais pas encore pour des fins académiques.
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
The Decoder (DE)10.08 · 21:02
