PP-OCRv6 亮相 Hugging Face:支持50种语言的文本识别模型,参数规模从1.5M到34.5M
PaddleOCR (Baidu)
PaddleOCR 团队发布了 PP-OCRv6,这是一组全新的通用 OCR 模型,支持 50 种语言。模型提供三种尺寸(tiny、small、medium),参数数量从 1.5M 到 34.5M 不等。与之前的 PP-OCRv5_server 版本相比,检测和识别性能显著提升。
PaddleOCR团队发布了PP-OCRv6——新一代通用OCR模型,用于真实场景下的文本检测与识别:文档、截图、多语言图像、数字显示屏、工业标签和街道文字。该系列包含三个级别——tiny(150万参数)、small(770万参数)和medium(3450万参数),其中medium和small支持50种语言,包括简体中文、繁体中文、英语、日语以及46种基于拉丁字母的语言。在PaddleOCR内部基准测试中,PP-OCRv6_medium模型达到了86.2%的检测Hmean和83.2%的识别准确率,分别比PP-OCRv5_server高出4.6和5.1个百分点。检测部分采用RepLKFPN——一种轻量级的大卷积核特征金字塔;识别部分则使用EncoderWithLightSVTR,将局部上下文建模与全局注意力相结合。开发者可以使用多种推理后端:Paddle Inference、Transformers(通过Hugging Face)和ONNX Runtime。提供的Python代码示例展示了如何在不同后端上运行OCR。模型以safetensors、Paddle和ONNX格式发布在Hugging Face Hub上,同时提供了在线演示。
来源: Hugging Face blog —
原文
