документа) и даже фотографии. Команда выбрала LLM (Large Language Model, большая языковая модель), развёрнутую on-prem (on-premises, на собственной инфраструктуре), чтобы коммерчески чувствительные данные не выходили за пределы компании, а для сканов и изображений использовала OCR (Optical Character Recognition, оптическое распознавание символов) на базе PaddleOCR. Этап предобработки конвертирует все входные данные в Markdown, сохраняя структуру документа, после чего LLM извлекает поля в JSON (JavaScript Object Notation, объектная нотация JavaScript) по заранее заданному контракту, который интегрируется с 1С. Далее следуют этапы жёсткой валидации: формальные проверки типов и длины полей, а также предметные правила для российских банковских реквизитов — контрольные суммы БИК (банковский идентификационный код), корреспондентского счёта, КПП (код причины постановки на учёт) и ИНН (идентификационный номер налогоплательщика). Изначально команда использовала модель qwen3-thinking-30b-a3b, но для продакшена перешла на openai/gpt-oss-120b, столкнувшись при этом с багом, из-за которого модель воспринимала номера счетов как числа и отбрасывала ведущие нули. В итоге пайплайн (pipeline, конвейер обработки) показал стопроцентную точность на тестовом наборе данных, а спустя полгода эксплуатации в продакшене он позволил сократить объём ручной работы и ускорить обработку счетов; в планах — расширить систему на другие типы документов.