Устаревшие OCR-тексты заставляют языковые модели учиться лишь с 30-процентной эффективностью — проект FineBooks намерен это изменить
Проект FineBooks от Hugging Face и EleutherAI протестировал 14 открытых OCR-моделей на более чем 2000 страницах исторических книг. Результаты показывают, что небольшие модели часто превосходят более крупных конкурентов, при этом лучшая модель достигает точности распознавания символов более 97% при затратах менее 2 долларов за тысячу страниц. По словам авторов, качество достаточно для обучения ИИ, но пока не для научных целей.
The Decoder (DE)10.08 · 21:02
