2000 identificaties per seconde: hoe u de juiste tabel op een document selecteert zonder neurale netwerken
Smart Engines
Meta
Smart Engines heeft een methode ontwikkeld om een doeltabel tussen meerdere tabelachtige regio's op een document te identificeren met behulp van reguliere expressies in plaats van neurale netwerken. Elke tabelregio wordt omgezet in een eendimensionale tekenreeks die de structuur en tekstinhoud codeert, die vervolgens wordt vergeleken met regex-patronen. De aanpak voert ongeveer 2000 identificaties per seconde uit op een mobiele processor en verbetert de herkenningskwaliteit op echte documenten.
Smart Engines heeft een methode ontwikkeld om de juiste tabel te identificeren tussen meerdere tabelachtige gebieden op een document, zonder gebruik te maken van neurale netwerken. Het systeem detecteert eerst mogelijke tabelgebieden en zet vervolgens elk gebied om in een eendimensionale string die zowel de geometrische structuur als de tekstinhoud codeert. Dit gebeurt door verticale lijnen en OCR-woorden op de X-as te projecteren, posities te markeren als lijnkwaliteitscijfers, tekstmarkeringen of lege punten, en deze samen te voegen tot een compacte handtekening. De identificatietaak wordt vervolgens teruggebracht tot het controleren van deze string tegen reguliere expressies die de verwachte tabelstructuur beschrijven. Er worden twee scenario's gebruikt: identificatie van een vaste structuur voor gestandaardiseerde formulieren zoals facturen, en identificatie van karakteristieke kolommen voor tabellen waarvan de kolomvolgorde kan variëren. Tests op Russische documenten (akten en facturen) toonden verminderingen aan in fouten bij het detecteren van rijen en kolommen tot respectievelijk 35,87% en 26,36%, met een verbetering van de nauwkeurigheid van celherkenning tot 9,97%. Het algoritme draait in 0,49 ms per gebied op ARMv8 64-bit, ongeveer 2000 controles per seconde, vergeleken met 1-3 seconden per kandidaat met een LLM-aanpak met Llama 3 op een pc. De methode werd ook toegepast om documenttypen te classificeren op basis van tabellenstructuur, waarbij 100% precisie en recall werden bereikt voor vijf van de zeven typen, beter dan een basisclassificatie op basis van velden.
Bron: Habr — хаб ML —
origineel
