新模型,老优势:DharmaOCR 专精葡萄牙语击败更新架构
Mistral
专为巴西葡萄牙语设计的光学字符识别模型 DharmaOCR,在葡萄牙语基准测试中超越了 Mistral OCR4 和 Unlimited-OCR 等新模型。这一优势是通过针对性训练和单一语言专精实现的。
创建巴西葡萄牙语光学字符识别模型DharmaOCR的研究人员将其与新近的Mistral OCR4和Unlimited-OCR模型进行了比较。尽管后两者代表了技术更先进的架构,采用了新颖的训练方法和数据集,但在仅针对葡萄牙语的基准测试中,DharmaOCR得分为0.925,而Mistral OCR4为0.798,Unlimited-OCR为0.7587。这一优势归因于专业化:DharmaOCR仅使用巴西葡萄牙语进行训练,将所有资源集中在这一语言领域,而更新的模型是多语言的,必须将其能力分配到多种语言中。此外,DharmaOCR训练流程中的直接偏好优化(Direct Preference Optimization)步骤减少了文本退化现象,即模型在模糊图像上开始生成不连贯的重复输出。多语言模型往往在葡萄牙语词汇和专有名词上出现典型的错误;例如,Mistral OCR4将巴西著名音乐家Chico Buarque的名字识别为“Chico Barque”,而Unlimited-OCR则识别为“chico bique”。据作者称,只要训练资源有限,专业化仍然是一种结构性优势,不会随着新架构的出现而消失。
来源: Hugging Face blog —
原文
