Novos Modelos, Mesma Vantagem: Especialização do DharmaOCR Supera Arquiteturas Mais Novas em Português
Mistral
O modelo de reconhecimento óptico de caracteres DharmaOCR, projetado para o português brasileiro, supera modelos mais novos como Mistral OCR4 e Unlimited-OCR em um benchmark de português. A vantagem é alcançada por meio de treinamento direcionado e especialização em um único idioma.
Os pesquisadores que criaram o modelo de reconhecimento óptico de caracteres DharmaOCR para o português brasileiro o compararam com os modelos mais recentes Mistral OCR4 e Unlimited-OCR. Embora ambos os últimos modelos representem arquiteturas tecnicamente mais avançadas, com métodos de treinamento e conjuntos de dados inovadores, o DharmaOCR obteve 0,925 contra 0,798 do Mistral OCR4 e 0,7587 do Unlimited-OCR em um benchmark direcionado exclusivamente ao português. A vantagem é atribuída à especialização: o DharmaOCR foi treinado apenas em português brasileiro, concentrando todos os seus recursos nesse domínio linguístico, enquanto os modelos mais novos são multilíngues e precisam distribuir suas capacidades entre muitos idiomas. Além disso, a etapa de Otimização de Preferência Direta no pipeline de treinamento do DharmaOCR reduziu a degeneração de texto, em que o modelo começa a gerar saídas incoerentes e repetitivas em imagens borradas. Modelos multilíngues frequentemente cometem erros característicos especificamente no vocabulário e em nomes próprios em português; por exemplo, o Mistral OCR4 transformou o nome do famoso músico brasileiro Chico Buarque em "Chico Barque", e o Unlimited-OCR em "chico bique". Segundo os autores, a especialização continua sendo uma vantagem estrutural que não desaparecerá com o advento de arquiteturas mais novas enquanto os recursos de treinamento forem finitos.
Fonte: Hugging Face blog —
original
