Eski OCR Metinleri Dil Modellerini Yalnızca Yüzde 30 Verimlilikle Öğretiyor – FineBooks Projesi Bunu Değiştirmeyi Hedefliyor
Hugging Face
EleutherAI
PaddleOCR (Baidu)
LightOn
DeepSeek
Hugging Face ve EleutherAI'nin FineBooks projesi, 14 açık OCR modelini 2.000'den fazla tarihi kitap sayfasında test etti. Sonuçlar, daha küçük modellerin genellikle daha büyük rakiplerinden daha iyi performans gösterdiğini ve en iyi modelin bin sayfa başına 2 dolardan az bir maliyetle yüzde 97'nin üzerinde karakter doğruluğu elde ettiğini gösteriyor. Yazarlara göre kalite, yapay zeka eğitimi için yeterli ancak akademik amaçlar için henüz yeterli değil.
Hugging Face ve EleutherAI tarafından yürütülen FineBooks projesi, 14 açık kaynaklı OCR modelini 2.165 tarihi kitap sayfası üzerinde test ederek sonuçları bir lider tablosu olarak yayınladı. Motivasyon, kütüphanelerdeki OCR metinlerinin genellikle hatalı olması ve bu tür metinlerle eğitilen bir dil modelinin, Talkie projesinin ölçümlerine göre insan transkripsiyonlarına kıyasla yalnızca %30 verimle öğrenmesidir. Önde gelen model dots.mocr, 3 milyar parametreye sahip ve bin sayfa başına 1,94 dolara %97,6 doğruluk oranına ulaşırken, yalnızca 0,9 milyar parametreye sahip OvisOCR2, bin sayfa başına 0,46 dolarla ikinci sırada yer alıyor. Bu, model boyutu ile OCR kalitesinin tarihi belgeler için neredeyse hiç ilişkili olmadığını gösteriyor. Değerlendirme yalnızca İngilizce, Fransızca, Almanca ve Latince'deki Antiqua yazı tiplerini kapsıyor ve tek sütunlu, akıcı metin içeren kitap benzeri belgelerle sınırlı. Sonraki adım olarak ekip, önde gelen modellerden biriyle yaklaşık 200.000 kamu malı BHL belgesini yeniden işlemeyi ve metni açık bir veri seti olarak yayınlamayı planlıyor. Modeller yapay zeka eğitimi için yeterince iyi olsa da, uzun s gibi arkaik karakterleri modern eşdeğerleriyle değiştiriyorlar; bu da akademik transkripsiyon için bir sorun. Yazarlara göre hedefli ince ayar bunu düzeltebilir.
Kaynak: The Decoder (DE) —
orijinal
