Los textos OCR heredados hacen que los modelos de lenguaje aprendan solo con un 30 por ciento de eficiencia: el proyecto FineBooks busca cambiar eso
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
El proyecto FineBooks de Hugging Face y EleutherAI probó 14 modelos OCR abiertos en más de 2.000 páginas de libros históricos. Los resultados muestran que los modelos más pequeños a menudo superan a competidores más grandes, con el mejor modelo logrando más del 97 por ciento de precisión de caracteres a menos de 2 dólares por mil páginas. Según los autores, la calidad es suficiente para el entrenamiento de IA, pero aún no para fines académicos.
El proyecto FineBooks de Hugging Face y EleutherAI ha evaluado 14 modelos OCR de código abierto sobre 2.165 páginas de libros históricos, publicando los resultados en una tabla de clasificación. La motivación es que los textos OCR procedentes de bibliotecas suelen contener errores, y un modelo de lenguaje entrenado con estos textos aprende solo al 30% de eficiencia en comparación con las transcripciones humanas, según cuantifica el proyecto Talkie. El modelo líder, dots.mocr, con 3 mil millones de parámetros, alcanza una precisión del 97,6% a un coste de 1,94 dólares por cada mil páginas, mientras que OvisOCR2, con solo 0,9 mil millones de parámetros, ocupa el segundo puesto a 0,46 dólares por cada mil páginas, lo que demuestra que el tamaño del modelo y la calidad del OCR apenas se correlacionan en documentos históricos. La evaluación cubre únicamente escritura Antiqua en inglés, francés, alemán y latín, y se limita a documentos tipo libro con texto fluido a una sola columna. Como siguiente paso, el equipo planea reprocesar aproximadamente 200.000 documentos del BHL de dominio público con uno de los modelos líderes y publicar el texto como un conjunto de datos abierto. Aunque los modelos son suficientemente buenos para el entrenamiento de IA, sustituyen caracteres arcaicos como la s larga por equivalentes modernos, lo que supone un problema para la transcripción académica; según los autores, un afinamiento específico podría resolverlo.
Fuente: The Decoder (DE) —
original
