ModelosCódigo Aberto 🇺🇸 27.07.2026 11:04

PP-OCRv6 no Hugging Face: Reconhecimento de Texto em 50 Idiomas com Modelos de 1,5M a 34,5M de Parâmetros

PaddleOCR (Baidu)PaddleOCR (Baidu)
A equipe do PaddleOCR lançou o PP-OCRv6, uma nova família de modelos universais de OCR que suporta 50 idiomas. Os modelos estão disponíveis em três tamanhos (pequeno, médio, grande) com contagens de parâmetros variando de 1,5M a 34,5M. A detecção e o reconhecimento foram significativamente melhorados em comparação com a versão anterior PP-OCRv5_server.
A equipe do PaddleOCR apresentou o PP-OCRv6, uma nova geração de modelos de OCR (Reconhecimento Óptico de Caracteres) universais para detecção e reconhecimento de texto em cenários reais: documentos, capturas de tela, imagens multilíngues, displays digitais, etiquetas industriais e texto de rua. A família inclui três níveis — tiny (1,5 milhão de parâmetros), small (7,7 milhões) e medium (34,5 milhões), sendo que os modelos medium e small suportam 50 idiomas, incluindo chinês simplificado e tradicional, inglês, japonês e 46 idiomas baseados no alfabeto latino. Em benchmarks internos do PaddleOCR, o modelo PP-OCRv6_medium alcança 86,2% de Hmean (média harmônica) na detecção e 83,2% de precisão no reconhecimento, o que representa um aumento de 4,6 e 5,1 pontos percentuais, respectivamente, em relação ao PP-OCRv5_server. Na detecção, é utilizado o RepLKFPN (Pirâmide de Características Leve com Grandes Núcleos de Convolução), e no reconhecimento, o EncoderWithLightSVTR, que combina modelagem local de contexto com atenção global. Para desenvolvedores, estão disponíveis vários backends de inferência: Paddle Inference, Transformers (via Hugging Face) e ONNX Runtime. Exemplos de código em Python mostram como executar o OCR com diferentes backends. Os modelos foram publicados no Hugging Face Hub nos formatos safetensors, Paddle e ONNX, e também há uma demonstração online disponível.
Fonte: Hugging Face blog — original
Nossos posts anteriores sobre este tópico ↓
Notícias frescas