アプリケーション研究 🇷🇺 13.08.2026 07:02

毎秒2000回の識別:ニューラルネットワークを使わずに文書上の目的の表を選択する方法

Smart EnginesSmart Engines MetaMeta
Smart Enginesは、ニューラルネットワークではなく正規表現を使用して、文書上の複数の表のような領域の中から目的の表を識別する方法を開発しました。各表領域は、その構造とテキスト内容をエンコードした1次元の文字列に変換され、正規表現パターンと照合されます。このアプローチはモバイルプロセッサ上で毎秒約2000回の識別を実行し、実際の文書における認識品質を向上させます。
Smart Enginesは、ニューラルネットワークを使用せずに、文書上の複数の表のような領域の中から正しい表を識別する方法を開発しました。このシステムはまず潜在的な表領域を検出し、次に各領域を、その幾何学的構造とテキスト内容の両方を符号化する一次元の文字列に変換します。これは、垂直線とOCRの単語をX軸に投影し、位置を線品質の数字、テキストマーカー、または空のドットとしてマークし、それらをコンパクトなシグネチャにマージすることで行われます。識別タスクは、予想される表構造を記述する正規表現に対してこの文字列をチェックすることに縮約されます。2つのシナリオが使用されます:請求書などの標準化されたフォームのための固定構造識別と、列の順序が異なる可能性がある表のための特性列識別です。ロシア語の文書(行為と請求書)でのテストでは、行と列の検出エラーがそれぞれ最大35.87%と26.36%削減され、セル認識精度が最大9.97%向上しました。このアルゴリズムはARMv8 64ビットで領域あたり0.49ミリ秒で実行され、毎秒約2000回のチェックが可能で、PC上でLlama 3を使用したLLMアプローチの候補あたり1〜3秒と比較されます。この方法は、表構造に基づく文書タイプの分類にも適用され、7タイプのうち5タイプで100%の適合率と再現率を達成し、ベースラインのフィールドベースの分類を上回りました。
出典: Habr — хаб ML — 原文
関連記事 ↓
新着ニュース