Mô hìnhMã nguồn mở 🇺🇸 27.07.2026 11:04

PP-OCRv6 trên Hugging Face: Nhận dạng văn bản bằng 50 ngôn ngữ với các mô hình từ 1,5 triệu đến 34,5 triệu tham số

PaddleOCR (Baidu)PaddleOCR (Baidu)
PP-OCRv6, thế hệ mới nhất của dòng mô hình OCR đa năng PaddleOCR, hiện đã có sẵn trên Hugging Face. Mô hình cung cấp ba cấp độ (tiny, small, medium) với số tham số từ 1,5 triệu đến 34,5 triệu, trong đó cấp medium và small hỗ trợ 50 ngôn ngữ. Mô hình cải thiện khả năng phát hiện và nhận dạng, đạt độ chính xác phát hiện Hmean lên tới 86,2% và độ chính xác nhận dạng 83,2%.
PP-OCRv6 là thế hệ mới nhất của dòng mô hình OCR đa năng PaddleOCR, được thiết kế cho nhận dạng và phát hiện văn bản trong thực tế trên tài liệu, ảnh chụp màn hình, hình ảnh đa ngôn ngữ, màn hình kỹ thuật số, nhãn công nghiệp và văn bản cảnh. Mô hình có ba cấp độ: tiny, small và medium, với số tham số từ 1,5 triệu đến 34,5 triệu. Các cấp độ medium và small hỗ trợ 50 ngôn ngữ bao gồm tiếng Trung Giản thể, tiếng Trung Phồn thể, tiếng Anh, tiếng Nhật và 46 ngôn ngữ hệ chữ Latinh. Trên các benchmark chính thức của PaddleOCR, PP-OCRv6 medium đạt độ chính xác phát hiện Hmean 86,2% và độ chính xác nhận dạng 83,2%, cải thiện lần lượt +4,6 và +5,1 điểm phần trăm so với PP-OCRv5 server. Mô hình sử dụng PPLCNetV4 làm backbone thống nhất, với RepLKFPN cho phát hiện và EncoderWithLightSVTR cho nhận dạng. Mô hình có thể triển khai với nhiều backend: Paddle Inference, Transformers (thư viện chuyển đổi mô hình) và ONNX Runtime. Các mô hình có sẵn trên Hugging Face Hub ở định dạng safetensors, Paddle inference và ONNX.
Nguồn: Hugging Face blog — bản gốc
Bài viết liên quan trước đây ↓
Tin mới