كيف وظفنا الذكاء الاصطناعي في المحاسبة وما الذي نتج عن ذلك
OpenAI
تشرح ألكسندرا تساريفا من شركة Infosystems Jet بناء خط أنابيب يعتمد على نموذج لغوي كبير محلي (LLM) وتقنية التعرف البصري على الحروف (OCR) لاستخراج بيانات منظمة من فواتير الدفع الروسية إلى نظام 1C. يتعامل الحل مع مجموعة متنوعة وغير منظمة من تنسيقات المستندات، ويطبق قواعد التحقق، ويعمل في بيئة الإنتاج منذ ستة أشهر بدقة 100% على مجموعة اختبار.
بدأ المشروع عندما طلب المحاسبون من فريق تعلّم الآلة (Machine Learning - ML) تدريب الذكاء الاصطناعي على قراءة الفواتير، التي كانت تأتي بصيغ غير منظمة: ملفات إكسل قديمة، ووثائق تحتوي على خطوط CID، وجداول وورد، وملفات PDF (Portable Document Format) متعددة الصفحات، وحتى صور فوتوغرافية. اختار الفريق نموذج لغوي كبير (Large Language Model - LLM) يعمل داخل بنية الشركة نفسها (on-prem) للحفاظ على سرية البيانات التجارية الحساسة، واستخدم تقنية التعرف الضوئي على الحروف (Optical Character Recognition - OCR) عبر أداة PaddleOCR لمعالجة المستندات الممسوحة والصور.
تتضمن مرحلة المعالجة المسبقة تحويل جميع المدخلات إلى صيغة Markdown مع الحفاظ على البنية، ثم يقوم النموذج اللغوي الكبير باستخراج الحقول ووضعها في عقد بيانات بصيغة JSON (JavaScript Object Notation) يتكامل مع نظام 1C. تلي ذلك عمليات تحقق صارمة: فحوصات شكلية لأنواع الحقول وأطوالها، بالإضافة إلى قواعد خاصة بالمجال للتحقق من تفاصيل البنوك الروسية مثل رمز BIK، والحساب المراسل، ورمز KPP، وأرقام التحقق الخاصة برمز INN.
استخدم الفريق في البداية نموذج qwen3-thinking-30b-a3b، ثم تحوّل إلى openai/gpt-oss-120b في مرحلة الإنتاج، بعد أن واجه خللاً كان النموذج يتعامل فيه مع أرقام الحسابات كأرقام رياضية، مما أدى إلى حذف الأصفار البادئة منها.
حقق خط المعالجة دقة بنسبة 100% على مجموعة الاختبار، وبعد ستة أشهر من التشغيل في بيئة الإنتاج، ساهم في تقليل العمل اليدوي وتسريع معالجة الفواتير، مع خطط لتوسيع نطاقه ليشمل أنواعاً أخرى من المستندات.
المصدر: Habr — хаб ИИ —
الأصلي
