2000 identifications par seconde : comment sélectionner le bon tableau dans un document sans réseaux de neurones
Smart Engines
Meta
Smart Engines a développé une méthode pour identifier un tableau cible parmi plusieurs zones ressemblant à des tableaux sur un document, en utilisant des expressions régulières au lieu de réseaux de neurones. Chaque zone de tableau est convertie en une chaîne unidimensionnelle encodant sa structure et son contenu textuel, qui est ensuite comparée à des motifs d'expressions régulières. L'approche effectue environ 2000 identifications par seconde sur un processeur mobile et améliore la qualité de reconnaissance sur des documents réels.
Smart Engines a développé une méthode pour identifier le bon tableau parmi plusieurs régions ressemblant à des tableaux sur un document, sans utiliser de réseaux de neurones. Le système détecte d'abord les régions potentielles de tableaux, puis convertit chaque région en une chaîne unidimensionnelle qui encode à la fois sa structure géométrique et son contenu textuel. Cela est réalisé en projetant des lignes verticales et des mots OCR sur l'axe des X, en marquant les positions comme des chiffres de qualité de ligne, des marqueurs de texte ou des points vides, et en les fusionnant en une signature compacte. La tâche d'identification se réduit ensuite à vérifier cette chaîne par rapport à des expressions régulières qui décrivent la structure attendue du tableau. Deux scénarios sont utilisés : l'identification de structure fixe pour les formulaires standardisés comme les factures, et l'identification de colonnes caractéristiques pour les tableaux où l'ordre des colonnes peut varier. Des tests sur des documents russes (actes et factures) ont montré des réductions des erreurs de détection de lignes et de colonnes allant jusqu'à 35,87 % et 26,36 % respectivement, avec une amélioration de la précision de reconnaissance des cellules allant jusqu'à 9,97 %. L'algorithme s'exécute en 0,49 ms par région sur ARMv8 64 bits, soit environ 2000 vérifications par seconde, contre 1 à 3 secondes par candidat avec une approche LLM utilisant Llama 3 sur un PC. La méthode a également été appliquée pour classifier les types de documents en fonction de la structure du tableau, atteignant une précision et un rappel de 100 % pour cinq des sept types, surpassant une classification de base basée sur les champs.
Source: Habr — хаб ML —
original
