旧式OCRテキストは言語モデルの学習効率を30パーセントに留める――FineBooksプロジェクトが変革を目指す
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
Hugging FaceとEleutherAIのFineBooksプロジェクトは、2,000ページ以上の歴史的な書籍ページで14のオープンソースOCRモデルをテストしました。その結果、小規模なモデルが大規模な競合他社を上回ることが多く、最上位モデルは1,000ページあたり2ドル未満で97パーセントを超える文字精度を達成しました。著者によると、その品質はAIトレーニングには十分ですが、学術目的にはまだ不十分です。
Hugging FaceとEleutherAIによるFineBooksプロジェクトは、2,165ページの歴史的な書籍ページで14のオープンソースOCRモデルをテストし、その結果をリーダーボードとして公開しました。その動機は、図書館のOCRテキストにはしばしば誤りがあり、そのようなテキストで学習した言語モデルの効率は、Talkieプロジェクトが定量化したように、人間の書き起こしと比較してわずか30%にとどまるという点にあります。リーディングモデルであるdots.mocrは30億パラメータを持ち、1,000ページあたり1.94ドルで97.6%の精度に達しています。一方、わずか9億パラメータのOvisOCR2は、1,000ページあたり0.46ドルで2位にランクインしており、歴史的な文書においては、モデルのサイズとOCR品質はほとんど相関しないことを示しています。この評価は、英語、フランス語、ドイツ語、ラテン語のアンティカ書体のみを対象としており、単一カラムの流れるようなテキストを持つ書籍状の文書に限定されています。次のステップとして、チームは主要なモデルの1つを使用して、約20万件のパブリックドメインのBHL文書を再処理し、そのテキストをオープンデータセットとして公開する予定です。モデルはAIトレーニングには十分な品質ですが、長いsなどの古い文字を現代の同等の文字に置き換えるため、学術的な書き起こしには問題があります。著者らによると、ターゲットを絞ったファインチューニングでこれを修正できるとのことです。
出典: The Decoder (DE) —
原文
