Open SourceИсследования 🇩🇪 10.08.2026 21:02

Устаревшие OCR-тексты заставляют языковые модели учиться лишь с 30-процентной эффективностью — проект FineBooks намерен это изменить

Hugging Face EleutherAI PaddleOCR (Baidu) LightOn DeepSeek
Проект FineBooks от Hugging Face и EleutherAI протестировал 14 открытых OCR-моделей на более чем 2000 страницах исторических книг. Результаты показывают, что небольшие модели часто превосходят более крупных конкурентов, при этом лучшая модель достигает точности распознавания символов более 97% при затратах менее 2 долларов за тысячу страниц. По словам авторов, качество достаточно для обучения ИИ, но пока не для научных целей.
Проект FineBooks от Hugging Face и EleutherAI протестировал 14 открытых OCR-моделей на 2165 страницах исторических книг, опубликовав результаты в виде лидерборда. Мотивация в том, что OCR-тексты из библиотек часто содержат ошибки, и языковая модель, обученная на таких текстах, достигает лишь 30% эффективности по сравнению с человеческими транскрипциями, как показал проект Talkie. Ведущая модель
Показать ещё ↓
Источник: The Decoder (DE) — оригинал
Наши предыдущие публикации по теме ↓
Свежие новости