Open SourceRecherche 🇩🇪 10.08.2026 21:02

Les textes OCR hérités ne permettent aux modèles de langue d'apprendre qu'à 30 pour cent d'efficacité – le projet FineBooks vise à changer cela

Hugging FaceHugging Face EleutherAIEleutherAI PaddleOCR (Baidu)PaddleOCR (Baidu) LightOnLightOn DeepSeekDeepSeek
Le projet FineBooks de Hugging Face et EleutherAI a testé 14 modèles OCR open source sur plus de 2 000 pages de livres historiques. Les résultats montrent que les modèles plus petits surpassent souvent les concurrents plus grands, le meilleur modèle atteignant plus de 97 pour cent de précision sur les caractères pour moins de 2 dollars par millier de pages. Selon les auteurs, la qualité est suffisante pour l'entraînement de l'IA, mais pas encore pour des fins académiques.
Le projet FineBooks, mené par Hugging Face et EleutherAI, a testé 14 modèles OCR open source sur 2 165 pages de livres historiques, publiant les résultats sous forme de classement. La motivation est que les textes OCR provenant de bibliothèques sont souvent défectueux, et qu'un modèle de langage entraîné sur de tels textes n'apprend qu'à 30 % d'efficacité par rapport aux transcriptions humaines, comme l'a quantifié le projet Talkie. Le modèle en tête, dots.mocr, doté de 3 milliards de paramètres, atteint une précision de 97,6 % pour 1,94 dollar par millier de pages, tandis qu'OvisOCR2, avec seulement 0,9 milliard de paramètres, se classe deuxième à 0,46 dollar par millier de pages, ce qui montre que la taille du modèle et la qualité de l'OCR sont à peine corrélées pour les documents historiques. L'évaluation ne couvre que les alphabets antiqua en anglais, français, allemand et latin, et se limite aux documents de type livre avec un texte fluide sur une seule colonne. Comme prochaine étape, l'équipe prévoit de retraiter environ 200 000 documents BHL du domaine public avec l'un des modèles en tête et de publier le texte en tant que jeu de données ouvert. Bien que les modèles soient suffisamment bons pour l'entraînement de l'IA, ils remplacent des caractères archaïques comme le s long par des équivalents modernes, ce qui pose problème pour la transcription savante ; un affinage ciblé pourrait résoudre ce problème, selon les auteurs.
Source: The Decoder (DE) — original
Nos articles précédents sur ce sujet ↓
Infos fraîches