ModelleOpen Source 🇺🇸 27.07.2026 11:04

PP-OCRv6 auf Hugging Face: Texterkennung in 50 Sprachen mit Modellen von 1,5 Mio. bis 34,5 Mio. Parametern

PaddleOCR (Baidu)PaddleOCR (Baidu)
Das PaddleOCR-Team hat PP-OCRv6 veröffentlicht, eine neue Familie universeller OCR-Modelle, die 50 Sprachen unterstützt. Die Modelle sind in drei Größen (tiny, small, medium) mit Parameterzahlen von 1,5 Mio. bis 34,5 Mio. verfügbar. Erkennung und Texterkennung wurden im Vergleich zur vorherigen PP-OCRv5_server-Version deutlich verbessert.
Das PaddleOCR-Team hat PP-OCRv6 vorgestellt, eine neue Generation universeller OCR-Modelle zur Texterkennung und -detektion in realen Szenarien wie Dokumenten, Screenshots, mehrsprachigen Bildern, digitalen Displays, Industrieetiketten und Straßentexten. Die Familie umfasst drei Stufen – Tiny (1,5 Millionen Parameter), Small (7,7 Millionen) und Medium (34,5 Millionen), wobei Medium und Small 50 Sprachen unterstützen, darunter vereinfachtes und traditionelles Chinesisch, Englisch, Japanisch und 46 lateinische Sprachen. In internen Benchmarks von PaddleOCR erreicht das Modell PP-OCRv6_medium einen Hmean-Wert von 86,2 % bei der Detektion und eine Erkennungsgenauigkeit von 83,2 %, was einem Anstieg um 4,6 beziehungsweise 5,1 Prozentpunkte gegenüber PP-OCRv5_server entspricht. Bei der Detektion kommt RepLKFPN zum Einsatz – eine leichte Merkmalspyramide mit großen Faltungskernen –, während bei der Erkennung EncoderWithLightSVTR verwendet wird, der lokale Kontextmodellierung mit globaler Aufmerksamkeit kombiniert. Für Entwickler stehen mehrere Inferenz-Backends zur Verfügung: Paddle Inference, Transformers (über Hugging Face) und ONNX Runtime. Python-Codebeispiele zeigen, wie OCR mit verschiedenen Backends ausgeführt wird. Die Modelle sind auf dem Hugging Face Hub in den Formaten safetensors, Paddle und ONNX veröffentlicht, außerdem gibt es eine Online-Demo.
Quelle: Hugging Face blog — Original
Unsere früheren Beiträge zu diesem Thema ↓
Aktuelle Nachrichten