开源研究 🇩🇪 10.08.2026 21:02

旧式OCR文本使语言模型学习效率仅为30%——FineBooks项目旨在改变这一现状

Hugging FaceHugging Face EleutherAIEleutherAI PaddleOCR (Baidu)PaddleOCR (Baidu) LightOnLightOn DeepSeekDeepSeek
Hugging Face与EleutherAI的FineBooks项目在超过2000页历史书籍上测试了14个开源OCR模型。结果显示,较小的模型往往优于较大的竞争对手,其中最佳模型在每千页成本不足2美元的情况下实现了超过97%的字符准确率。据作者称,其质量足以用于人工智能训练,但尚不足以达到学术用途。
Hugging Face 和 EleutherAI 的 FineBooks 项目测试了 14 个开源 OCR 模型在 2,165 页历史书籍上的表现,并将结果以排行榜形式发布。其动机在于,图书馆的 OCR 文本往往存在缺陷,而根据 Talkie 项目的量化,在此类文本上训练的语言模型学习效率仅为人工转写文本的 30%。领先的模型 dots.mocr 拥有 30 亿参数,在每千页 1.94 美元的成本下达到 97.6% 的准确率,而 OvisOCR2 仅有 9 亿参数,以每千页 0.46 美元的成本排名第二,这表明对于历史文献,模型大小与 OCR 质量几乎不相关。评估仅涵盖英文、法文、德文和拉丁文的 Antiqua 字体,且仅限于单栏流动文本的书籍类文档。作为下一步,团队计划使用领先模型之一重新处理约 20 万份公有领域的 BHL 文档,并将文本作为开放数据集发布。虽然这些模型足以用于 AI 训练,但它们会将长 s 等古老字符替换为现代等价物,这对学术转写来说是个问题;作者认为,针对性的微调可以解决这一问题。
来源: The Decoder (DE) — 原文
我们之前关于此话题的帖子 ↓
最新新闻