2000 identificaciones por segundo: cómo seleccionar la tabla correcta en un documento sin redes neuronales
Smart Engines
Meta
Smart Engines ha desarrollado un método para identificar una tabla objetivo entre múltiples regiones similares a tablas en un documento, utilizando expresiones regulares en lugar de redes neuronales. Cada región de tabla se convierte en una cadena unidimensional que codifica su estructura y contenido de texto, y luego se compara con patrones de expresiones regulares. El enfoque realiza aproximadamente 2000 identificaciones por segundo en un procesador móvil y mejora la calidad del reconocimiento en documentos reales.
Smart Engines ha desarrollado un método para identificar la tabla correcta entre múltiples regiones similares a tablas en un documento sin utilizar redes neuronales. El sistema primero detecta posibles regiones de tabla, luego convierte cada región en una cadena unidimensional que codifica tanto su estructura geométrica como su contenido de texto. Esto se logra proyectando líneas verticales y palabras OCR en el eje X, marcando posiciones como dígitos de calidad de línea, marcadores de texto o puntos vacíos, y fusionándolos en una firma compacta. La tarea de identificación se reduce entonces a verificar esta cadena contra expresiones regulares que describen la estructura de tabla esperada. Se utilizan dos escenarios: identificación de estructura fija para formularios estandarizados como facturas, e identificación de columnas características para tablas donde el orden de las columnas puede variar. Las pruebas en documentos rusos (actas y facturas) mostraron reducciones en los errores de detección de filas y columnas de hasta un 35.87% y 26.36% respectivamente, con una mejora en la precisión del reconocimiento de celdas de hasta un 9.97%. El algoritmo se ejecuta en 0.49 ms por región en ARMv8 de 64 bits, unas 2000 comprobaciones por segundo, en comparación con 1-3 segundos por candidato utilizando un enfoque de grandes modelos de lenguaje con Llama 3 en una PC. El método también se aplicó para clasificar tipos de documentos basados en la estructura de la tabla, logrando una precisión y exhaustividad del 100% para cinco de siete tipos, superando una clasificación base basada en campos.
Fuente: Habr — хаб ML —
original
