초당 2천 회 식별: 신경망 없이 문서에서 올바른 표를 선택하는 방법
Smart Engines
Meta
Smart Engines가 신경망 대신 정규 표현식을 사용하여 문서의 여러 표 모양 영역 중에서 대상 표를 식별하는 방법을 개발했습니다. 각 표 영역은 구조와 텍스트 내용을 인코딩하는 1차원 문자열로 변환된 후 정규 표현식 패턴과 매칭됩니다. 이 접근 방식은 모바일 프로세서에서 초당 약 2천 회의 식별을 수행하며 실제 문서에서 인식 품질을 향상시킵니다.
Smart Engines는 신경망을 사용하지 않고 문서에서 여러 테이블 유사 영역 중 올바른 테이블을 식별하는 방법을 개발했습니다. 이 시스템은 먼저 잠재적인 테이블 영역을 감지한 다음 각 영역을 기하학적 구조와 텍스트 내용을 모두 인코딩하는 1차원 문자열로 변환합니다. 이는 수직선과 OCR 단어를 X축에 투영하고, 위치를 선 품질 숫자, 텍스트 마커 또는 빈 점으로 표시하고 이를 압축된 시그니처로 병합하여 수행됩니다. 식별 작업은 이 문자열을 예상 테이블 구조를 설명하는 정규 표현식과 대조하는 것으로 축소됩니다. 두 가지 시나리오가 사용됩니다: 인보이스와 같은 표준화된 양식에 대한 고정 구조 식별과 열 순서가 다를 수 있는 테이블에 대한 특징 열 식별입니다. 러시아 문서(행위 및 인보이스)에 대한 테스트에서 행 및 열 감지 오류가 각각 최대 35.87% 및 26.36% 감소했으며, 셀 인식 정확도는 최대 9.97% 향상되었습니다. 알고리즘은 ARMv8 64비트에서 영역당 0.49밀리초, 초당 약 2000회의 검사를 실행하며, PC에서 Llama 3를 사용한 LLM 방식의 후보당 1~3초와 비교됩니다. 이 방법은 또한 테이블 구조를 기반으로 문서 유형을 분류하는 데 적용되어 7개 유형 중 5개에 대해 정밀도와 재현율 100%를 달성하여 기준 필드 기반 분류보다 우수한 성능을 보였습니다.
출처: Habr — хаб ML —
원문
