بناء خط أنابيب التعرف الضوئي على الحروف (OCR) الشامل باستخدام Baidu Unlimited-OCR للصور عالية الدقة وملفات PDF متعددة الصفحات
Baidu
يشرح هذا البرنامج التعليمي بناء سير عمل كامل للتعرف الضوئي على الحروف (OCR) باستخدام نموذج Baidu Unlimited-OCR لصور المستندات وملفات PDF متعددة الصفحات. يغطي إعداد بيئة GPU، تحميل النموذج، الاستدلال بصفحة واحدة في وضعي Gundam و Base، وتحليل PDF متعدد الصفحات باستخدام PyMuPDF.
يرشد هذا البرنامج التعليمي إلى بناء سير عمل كامل لنموذج التعرف الضوئي على الحروف غير المحدود (Unlimited-OCR) من بايدو، لتطبيقه على صور المستندات وملفات PDF متعددة الصفحات. يبدأ بتهيئة بيئة وحدة معالجة الرسوميات (GPU)، وتثبيت التبعيات، وتحميل نموذج الرؤية واللغة (vision-language model) الذي يضم 3 مليارات معلَمة (3B parameters) مع اختيار نوع البيانات (dtype) تلقائيًا. يُنشئ مستندات نموذجية منظمة للاختبار. يقيم سير العمل وضع الاستدلال المقسم (Gundam inference mode) المُجرب والوضع الأساسي الأسرع (Base mode) للتعرف على الصفحة الواحدة، ثم يتوسع إلى تحليل ملفات PDF متعددة الصفحات باستخدام مكتبة PyMuPDF والدالة infer_multi(). يحافظ على إعدادات التوليد الطويلة السياق (long-context generation settings)، وضوابط التكرار (repetition controls)، ومعالجة المخرجات المنظمة للتعامل مع التخطيطات الكثيفة والجداول والفقرات والمحتوى العابر للصفحات. تلخص الورقة المرجعية النهائية الأوضاع الموصى بها لأنواع المستندات المختلفة.
المصدر: MarkTechPost —
الأصلي
