линий и слов, распознанных оптическим распознаванием символов (OCR), на ось абсцисс, с пометкой позиций как цифр качества линий, маркеров текста или пустых точек, и их объединением в компактную сигнатуру. Затем задача идентификации сводится к проверке этой строки на соответствие регулярным выражениям, описывающим ожидаемую структуру таблицы. Используются два сценария: идентификация фиксированной структуры для стандартизированных форм, таких как счета-фактуры, и идентификация характерных столбцов для таблиц, где порядок столбцов может варьироваться. Тесты на русскоязычных документах (актах и счетах-фактурах) показали снижение ошибок обнаружения строк и столбцов до 35,87% и 26,36% соответственно, при этом точность распознавания ячеек улучшилась до 9,97%. Алгоритм выполняется за 0,49 мс на область на ARMv8 64-бит, что составляет около 2000 проверок в секунду, по сравнению с 1-3 секундами на кандидата при использовании подхода на основе большой языковой модели (LLM) с Llama 3 на персональном компьютере. Метод также был применён для классификации типов документов на основе структуры таблицы, достигнув 100% точности и полноты для пяти из семи типов, превосходя базовый метод классификации на основе полей.