ModelRiset 🇺🇸 27.07.2026 01:05

Model Baru, Keunggulan Sama: Spesialisasi DharmaOCR Mengalahkan Arsitektur Baru dalam Bahasa Portugis

MistralMistral
Model pengenalan karakter optik DharmaOCR, yang dirancang untuk bahasa Portugis Brasil, mengungguli model-model baru seperti Mistral OCR4 dan Unlimited-OCR dalam sebuah tolok ukur bahasa Portugis. Keunggulan ini dicapai melalui pelatihan yang ditargetkan dan spesialisasi dalam satu bahasa.
Para peneliti yang menciptakan model pengenalan karakter optis DharmaOCR untuk bahasa Portugis Brasil membandingkannya dengan model Mistral OCR4 dan Unlimited-OCR yang lebih baru. Meskipun kedua model terakhir tersebut mewakili arsitektur yang secara teknis lebih maju dengan metode pelatihan dan kumpulan data baru, DharmaOCR mencetak skor 0,925 berbanding 0,798 untuk Mistral OCR4 dan 0,7587 untuk Unlimited-OCR dalam tolok ukur yang menargetkan bahasa Portugis secara eksklusif. Keunggulan ini dikaitkan dengan spesialisasi: DharmaOCR dilatih hanya pada bahasa Portugis Brasil, memusatkan seluruh sumber dayanya pada domain bahasa ini, sementara model yang lebih baru bersifat multibahasa dan harus mendistribusikan kemampuannya ke banyak bahasa. Selain itu, langkah Direct Preference Optimization dalam pipa pelatihan DharmaOCR mengurangi degenerasi teks, di mana model mulai menghasilkan keluaran repetitif yang tidak koheren pada gambar buram. Model multibahasa sering membuat kesalahan karakteristik khusus pada kosakata dan nama diri bahasa Portugis; misalnya, Mistral OCR4 mengubah nama musisi Brasil terkenal Chico Buarque menjadi "Chico Barque", dan Unlimited-OCR menjadi "chico bique". Menurut para penulis, spesialisasi tetap menjadi keunggulan struktural yang tidak akan hilang dengan munculnya arsitektur yang lebih baru selama sumber daya pelatihan masih terbatas.
Sumber: Hugging Face blog — asli
Postingan kami sebelumnya tentang topik ini ↓
Berita terbaru