每秒识别2000次:如何在文档中不使用神经网络选择正确的表格
Smart Engines
Meta
Smart Engines开发了一种方法,通过正则表达式而非神经网络来识别文档中多个类似表格区域中的目标表格。每个表格区域被转换为一维字符串,编码其结构和文本内容,然后与正则表达式模式进行匹配。该方法在移动处理器上每秒可运行约2000次识别,并提高了真实文档上的识别质量。
Smart Engines开发了一种方法,能够在不需要神经网络的情况下,识别文档中多个类似表格区域中的正确表格。系统首先检测潜在的表格区域,然后将每个区域转换为一维字符串,该字符串同时编码其几何结构和文本内容。这是通过将垂直线和OCR单词投影到X轴上,将位置标记为线质量数字、文本标记或空点,并将它们合并成紧凑的签名来完成的。识别任务随后简化为将该字符串与描述预期表格结构的正则表达式进行匹配。使用了两种场景:针对标准化表单(如发票)的固定结构识别,以及针对列顺序可能变化的表格的特征列识别。在俄语文档(法案和发票)上的测试显示,行和列检测错误率分别降低了高达35.87%和26.36%,单元格识别准确率提高了高达9.97%。该算法在ARMv8 64位平台上每个区域运行时间为0.49毫秒,每秒约2000次检查,而使用Llama 3的LLM方法在个人电脑上每个候选需要1至3秒。该方法还应用于基于表格结构的文档类型分类,在七种类型中的五种上实现了100%的精确率和召回率,优于基于字段的分类基线。
来源: Habr — хаб ML —
原文
