FrameworksModelle 🇷🇺 01.08.2026 04:01

Wie man im Jahr 2026 eine OCR auswählt: Test von neun Modellen auf drei Inferenz-Engines für russische Handschrift

PaddleOCR (Baidu)PaddleOCR (Baidu) DeepSeekDeepSeek Alibaba/QwenAlibaba/Qwen
Der Artikel präsentiert einen Benchmark von neun OCR-Modellen (traditionelle und VLM) über drei Inferenz-Engines (vLLM, SGLang, Native HF) für russische Handschrift. Wichtigste Erkenntnisse: PaddleOCR-VL (1.7B) ist mehr als fünfmal schneller als Qwen2.5-VL-7B, Tesseracts Geschwindigkeit ist irreführend aufgrund geringer Ausgabevollständigkeit, und Native HF ist für die Produktion ungeeignet. Empfehlungen für verschiedene Szenarien werden in einer Tabelle gegeben.
Der Artikel aus dem KI-Hub von Habr vergleicht eine Reihe von OCR-Lösungen für russische Handschrift. Neun Modelle wurden auf den Engines vLLM, SGLang und nativen HF Transformers gegen einen Datensatz russischer handgeschriebener Texte getestet. Die Autoren berichten, dass Tesseract, obwohl es mit 193 Seiten pro Minute am schnellsten ist, nur 411 Zeichen pro Seite liefert, während PaddleOCR-VL 1193 Token ergibt, was darauf hindeutet, dass eine höhere Geschwindigkeit oft bedeutet, dass Inhalte fehlen. Das spezialisierte PaddleOCR-VL (1,7B) übertrifft das allgemeine Qwen2.5-VL-7B um das 5,2-fache bei Seiten pro Minute und um das 6,7-fache bei Token pro Sekunde. Native HF Transformers bleiben hinter vLLM und SGLang um das Zweifache für dasselbe Modell zurück, aufgrund geringerer GPU-Auslastung. Die Benchmarks zeigen, dass für einfache gedruckte Dokumente CPU-basiertes Tesseract oder RapidOCR ausreichen, während für komplexe Layouts, Tabellen und Markdown-Ausgabe PaddleOCR-VL mit SGLang empfohlen wird, und für die Produktion mit minimalen Kompatibilitätsrisiken PaddleOCR-VL mit vLLM. Für allgemeine Aufgaben ist Qwen2.5-VL-7B mit vLLM geeignet, und für lokale russischsprachige VLM wird Cotype Light 3 mit vLLM und MTP vorgeschlagen. Die Tests wurden auf einer gemeinsamen NVIDIA A100 80GB mit batch=1 und 15 russischen Handschriftproben durchgeführt, mit einheitlichen Einstellungen wie bfloat16-Präzision, Temperatur 0,0 und spezifischem Prompting.
Quelle: Habr — хаб ИИ — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten