Aufbau einer End-to-End-OCR-Pipeline mit Baidu Unlimited-OCR für hochauflösende Bilder und mehrseitige PDFs
Baidu
Dieses Tutorial zeigt den Aufbau eines vollständigen OCR-Workflows mit Baidus Unlimited-OCR-Modell für Dokumentenbilder und mehrseitige PDFs. Es behandelt die Einrichtung der GPU-Umgebung, das Laden des Modells, die Einzelseiteninferenz im Gundam- und Base-Modus sowie die Analyse mehrseitiger PDFs mit PyMuPDF.
Das Tutorial erstellt einen kompletten Workflow für Baidus Unlimited-OCR-Modell auf Dokumentbildern und mehrseitigen PDFs. Es konfiguriert die GPU-Umgebung, installiert Abhängigkeiten und lädt das visuell-sprachliche Modell mit 3 Milliarden Parametern mit automatischer Datentypauswahl. Es generiert strukturierte Beispieldokumente zum Testen. Der Workflow evaluiert sowohl den geteilten (tiled) Gundam-Inferenzmodus als auch den schnelleren Basismodus (Base mode) für einseitige OCR, bevor er mit PyMuPDF und infer_multi() zur mehrseitigen PDF-Analyse übergeht. Es behält Einstellungen für die Generierung mit langem Kontext, Wiederholungskontrollen und strukturierte Ausgabeverarbeitung bei, um dichte Layouts, Tabellen, Absätze und seitenübergreifende Inhalte zu verarbeiten. Das abschließende Cheat Sheet fasst empfohlene Modi für verschiedene Dokumenttypen zusammen.
Quelle: MarkTechPost —
Original
