旧式OCR文本使语言模型学习效率仅为30%——FineBooks项目旨在改变这一现状
Hugging Face与EleutherAI的FineBooks项目在超过2000页历史书籍上测试了14个开源OCR模型。结果显示,较小的模型往往优于较大的竞争对手,其中最佳模型在每千页成本不足2美元的情况下实现了超过97%的字符准确率。据作者称,其质量足以用于人工智能训练,但尚不足以达到学术用途。
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
The Decoder (DE)10.08 · 21:02
