Mô hình mới, cùng lợi thế: Chuyên biệt hóa DharmaOCR vượt trội hơn các kiến trúc mới hơn trong tiếng Bồ Đào Nha
Mistral
Mô hình nhận dạng ký tự quang học DharmaOCR, được thiết kế cho tiếng Bồ Đào Nha Brazil, vượt trội hơn các mô hình mới hơn như Mistral OCR4 và Unlimited-OCR trong một bài kiểm tra chuẩn tiếng Bồ Đào Nha. Lợi thế này đạt được thông qua đào tạo có mục tiêu và chuyên biệt hóa trong một ngôn ngữ duy nhất.
Pesquisadores que criaram o modelo de reconhecimento óptico de caracteres DharmaOCR para português brasileiro o compararam com os modelos mais recentes Mistral OCR4 e Unlimited-OCR. Embora ambos os últimos modelos representem arquiteturas tecnicamente mais avançadas, com métodos de treinamento e conjuntos de dados inovadores, o DharmaOCR obteve 0,925 contra 0,798 do Mistral OCR4 e 0,7587 do Unlimited-OCR em um benchmark focado exclusivamente em português. A vantagem é atribuída à especialização: o DharmaOCR foi treinado apenas em português brasileiro, concentrando todos os seus recursos nesse domínio linguístico, enquanto os modelos mais novos são multilíngues e precisam distribuir suas capacidades entre vários idiomas. Além disso, a etapa de Otimização Direta de Preferência no pipeline de treinamento do DharmaOCR reduziu a degeneração textual, onde o modelo começa a gerar saídas repetitivas e incoerentes em imagens borradas. Modelos multilíngues frequentemente cometem erros característicos especificamente no vocabulário e em nomes próprios do português; por exemplo, o Mistral OCR4 transformou o nome do famoso músico brasileiro Chico Buarque em "Chico Barque", e o Unlimited-OCR em "chico bique". Segundo os autores, a especialização continua sendo uma vantagem estrutural que não desaparecerá com o surgimento de arquiteturas mais novas, enquanto os recursos de treinamento forem finitos.
Nguồn: Hugging Face blog —
bản gốc
