ModelosInvestigación 🇺🇸 27.07.2026 01:05

Nuevos modelos, misma ventaja: la especialización de DharmaOCR supera a arquitecturas más nuevas en portugués

MistralMistral
El modelo de reconocimiento óptico de caracteres DharmaOCR, diseñado para el portugués brasileño, supera a modelos más nuevos como Mistral OCR4 y Unlimited-OCR en un benchmark de portugués. La ventaja se logra mediante un entrenamiento dirigido y la especialización en un solo idioma.
Los investigadores que crearon el modelo de reconocimiento óptico de caracteres DharmaOCR para portugués brasileño lo compararon con los modelos más recientes Mistral OCR4 y Unlimited-OCR. Aunque ambos modelos posteriores representan arquitecturas técnicamente más avanzadas con métodos de entrenamiento y conjuntos de datos novedosos, DharmaOCR obtuvo una puntuación de 0,925 frente a 0,798 de Mistral OCR4 y 0,7587 de Unlimited-OCR en un punto de referencia dirigido exclusivamente al portugués. La ventaja se atribuye a la especialización: DharmaOCR fue entrenado solo con portugués brasileño, concentrando todos sus recursos en este dominio lingüístico, mientras que los modelos más nuevos son multilingües y deben distribuir sus capacidades entre muchos idiomas. Además, el paso de Optimización Directa de Preferencias en el proceso de entrenamiento de DharmaOCR redujo la degeneración textual, donde el modelo comienza a generar resultados repetitivos e incoherentes en imágenes borrosas. Los modelos multilingües suelen cometer errores característicos específicamente en el vocabulario y los nombres propios del portugués; por ejemplo, Mistral OCR4 convirtió el nombre del famoso músico brasileño Chico Buarque en "Chico Barque", y Unlimited-OCR en "chico bique". Según los autores, la especialización sigue siendo una ventaja estructural que no desaparecerá con la llegada de arquitecturas más nuevas mientras los recursos de entrenamiento sean finitos.
Fuente: Hugging Face blog — original
Nuestros artículos anteriores sobre este tema ↓
Noticias frescas