Baidu Unlimited-OCR ile Yüksek Çözünürlüklü Görüntüler ve Çok Sayfalı PDF'ler için Uçtan Uca OCR Boru Hattı Oluşturma
Baidu
Bu eğitim, belge görüntüleri ve çok sayfalı PDF'ler için Baidu'nun Unlimited-OCR modelini kullanarak eksiksiz bir OCR iş akışı oluşturmayı göstermektedir. GPU ortamı kurulumu, model yükleme, Gundam ve Base modlarında tek sayfa çıkarımı ve PyMuPDF ile çok sayfalı PDF ayrıştırmasını kapsar.
Bu eğitim, belge görüntüleri ve çok sayfalı PDF'ler için Baidu'nun Unlimited-OCR modelini kullanan eksiksiz bir iş akışı oluşturur. GPU ortamını yapılandırır, bağımlılıkları kurar ve otomatik veri türü seçimiyle 3 milyar parametreli görsel-dil modelini yükler. Test için yapılandırılmış örnek belgeler oluşturur. İş akışı, tek sayfalık OCR için döşemeli Gundam çıkarım modu ve daha hızlı Base modu değerlendirir, ardından PyMuPDF ve infer_multi() ile çok sayfalı PDF ayrıştırmaya geçer. Uzun bağlam oluşturma ayarlarını, tekrar kontrollerini ve yapılandırılmış çıktı işlemeyi koruyarak yoğun düzenleri, tabloları, paragrafları ve sayfalar arası içeriği işler. Son kopya kağıdı, farklı belge türleri için önerilen modları özetler.
Kaynak: MarkTechPost —
orijinal
