Código AbertoPesquisa 🇩🇪 10.08.2026 21:02

Textos Legados de OCR Fazem Modelos de Linguagem Aprenderem com Apenas 30% de Eficiência – o Projeto FineBooks Visa Mudar Isso

Hugging FaceHugging Face EleutherAIEleutherAI PaddleOCR (Baidu)PaddleOCR (Baidu) LightOnLightOn DeepSeekDeepSeek
O projeto FineBooks, da Hugging Face e da EleutherAI, testou 14 modelos de OCR abertos em mais de 2.000 páginas de livros históricos. Os resultados mostram que modelos menores frequentemente superam concorrentes maiores, com o melhor modelo alcançando mais de 97% de precisão de caracteres a menos de $2 por mil páginas. Segundo os autores, a qualidade é suficiente para treinamento de IA, mas ainda não para fins acadêmicos.
O projeto FineBooks, da Hugging Face e EleutherAI, testou 14 modelos de OCR de código aberto em 2.165 páginas de livros históricos, publicando os resultados em um ranking. A motivação é que os textos de OCR provenientes de bibliotecas frequentemente apresentam erros, e um modelo de linguagem treinado nesses textos aprende com apenas 30% de eficiência em comparação com transcrições humanas, conforme quantificado pelo projeto Talkie. O modelo líder, dots.mocr, tem 3 bilhões de parâmetros e atinge 97,6% de precisão a um custo de 1,94 dólares por mil páginas, enquanto o OvisOCR2, com apenas 0,9 bilhão de parâmetros, ocupa o segundo lugar a 0,46 dólares por mil páginas, mostrando que o tamanho do modelo e a qualidade do OCR dificilmente se correlacionam para documentos históricos. A avaliação cobre apenas escritas Antiqua em inglês, francês, alemão e latim, e é limitada a documentos semelhantes a livros com texto fluido em coluna única. Como próximo passo, a equipe planeja reprocessar cerca de 200.000 documentos de domínio público do BHL com um dos modelos líderes e publicar o texto como um conjunto de dados aberto. Embora os modelos sejam bons o suficiente para treinamento de IA, eles substituem caracteres arcaicos, como o s longo, por equivalentes modernos, o que é um problema para transcrição acadêmica; de acordo com os autores, um ajuste fino direcionado poderia corrigir isso.
Fonte: The Decoder (DE) — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas