ModellenOnderzoek 🇺🇸 27.07.2026 01:05

Nieuwe Modellen, Zelfde Voordeel: DharmaOCR-Specialisatie Verslaat Nieuwere Architecturen in het Portugees

MistralMistral
Het optische tekenherkenningsmodel DharmaOCR, ontworpen voor Braziliaans Portugees, presteert beter dan nieuwere modellen zoals Mistral OCR4 en Unlimited-OCR in een Portugese benchmark. Het voordeel wordt behaald door gerichte training en specialisatie in één taal.
Onderzoekers die het DharmaOCR-model voor optische tekenherkenning voor Braziliaans-Portugees hebben gemaakt, vergeleken het met de nieuwere modellen Mistral OCR4 en Unlimited-OCR. Hoewel deze laatste twee modellen technisch geavanceerdere architecturen hebben met nieuwe trainingsmethoden en datasets, scoorde DharmaOCR 0,925 tegen 0,798 voor Mistral OCR4 en 0,7587 voor Unlimited-OCR in een benchmark die uitsluitend gericht was op Portugees. Het voordeel wordt toegeschreven aan specialisatie: DharmaOCR is alleen getraind op Braziliaans-Portugees en concentreert al zijn middelen op dit taaldomein, terwijl de nieuwere modellen meertalig zijn en hun mogelijkheden over vele talen moeten verdelen. Bovendien verminderde de stap Direct Preference Optimization in de trainingspijplijn van DharmaOCR tekstdegeneratie, waarbij het model onsamenhangende, herhalende output begint te genereren bij wazige afbeeldingen. Meertalige modellen maken vaak karakteristieke fouten specifiek met Portugese woorden en eigennamen; Mistral OCR4 veranderde bijvoorbeeld de naam van de beroemde Braziliaanse muzikant Chico Buarque in 'Chico Barque', en Unlimited-OCR in 'chico bique'. Volgens de auteurs blijft specialisatie een structureel voordeel dat niet zal verdwijnen met de komst van nieuwere architecturen zolang trainingsmiddelen eindig zijn.
Bron: Hugging Face blog — origineel
Eerdere berichten over dit onderwerp ↓
Vers nieuws