Los textos OCR heredados hacen que los modelos de lenguaje aprendan solo con un 30 por ciento de eficiencia: el proyecto FineBooks busca cambiar eso
El proyecto FineBooks de Hugging Face y EleutherAI probó 14 modelos OCR abiertos en más de 2.000 páginas de libros históricos. Los resultados muestran que los modelos más pequeños a menudo superan a competidores más grandes, con el mejor modelo logrando más del 97 por ciento de precisión de caracteres a menos de 2 dólares por mil páginas. Según los autores, la calidad es suficiente para el entrenamiento de IA, pero aún no para fines académicos.
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
The Decoder (DE)10.08 · 21:02
