Mã nguồn mởNghiên cứu 🇩🇪 10.08.2026 21:02

Văn bản OCR cũ khiến mô hình ngôn ngữ học chỉ đạt hiệu suất 30% – dự án FineBooks nhằm thay đổi điều đó

Hugging FaceHugging Face EleutherAIEleutherAI PaddleOCR (Baidu)PaddleOCR (Baidu) LightOnLightOn DeepSeekDeepSeek
Dự án FineBooks của Hugging Face và EleutherAI đã thử nghiệm 14 mô hình OCR mã nguồn mở trên hơn 2.000 trang sách lịch sử. Kết quả cho thấy các mô hình nhỏ thường vượt trội hơn các đối thủ lớn hơn, với mô hình tốt nhất đạt độ chính xác ký tự trên 97% với chi phí dưới 2 đô la Mỹ cho mỗi nghìn trang. Theo các tác giả, chất lượng này đủ để huấn luyện trí tuệ nhân tạo nhưng chưa đủ cho mục đích học thuật.
Hugging Face và EleutherAI thực hiện dự án FineBooks, đã thử nghiệm 14 mô hình OCR mã nguồn mở trên 2.165 trang sách lịch sử và công bố kết quả dưới dạng bảng xếp hạng. Động lực của dự án là văn bản OCR từ các thư viện thường có lỗi, và một mô hình ngôn ngữ được huấn luyện trên các văn bản như vậy chỉ đạt hiệu quả 30% so với bản phiên âm của con người, theo định lượng từ dự án Talkie. Mô hình dẫn đầu, dots.mocr, có 3 tỷ tham số và đạt độ chính xác 97,6% với chi phí 1,94 đô la mỗi nghìn trang, trong khi OvisOCR2, chỉ với 0,9 tỷ tham số, xếp thứ hai với chi phí 0,46 đô la mỗi nghìn trang, cho thấy kích thước mô hình và chất lượng OCR gần như không tương quan với nhau đối với tài liệu lịch sử. Đánh giá chỉ bao gồm chữ Antiqua trong các ngôn ngữ Anh, Pháp, Đức và La-tinh, và chỉ giới hạn trong các tài liệu dạng sách có văn bản trôi chảy một cột. Bước tiếp theo, nhóm dự định xử lý lại khoảng 200.000 tài liệu BHL thuộc phạm vi công cộng bằng một trong các mô hình dẫn đầu và công bố văn bản dưới dạng tập dữ liệu mở. Mặc dù các mô hình này đủ tốt cho việc huấn luyện AI, chúng thay thế các ký tự cổ như chữ s dài bằng các ký tự hiện đại tương đương, điều này gây khó khăn cho việc phiên âm học thuật; theo các tác giả, việc tinh chỉnh có mục tiêu có thể khắc phục vấn đề này.
Nguồn: The Decoder (DE) — bản gốc
Bài viết liên quan trước đây ↓
Tin mới