Hoe We AI Inzetten in de Administratie en Wat Het Opleverde
OpenAI
Alexandra Tsareva van Infosystems Jet beschrijft hoe zij een on-premise taalmodel en OCR-pijplijn bouwde om gestructureerde gegevens uit Russische betalingsfacturen te extraheren naar 1C. De oplossing verwerkt een rommelige verscheidenheid aan documentformaten, past validatieregels toe en draait al zes maanden in productie met 100% nauwkeurigheid op een testset.
Het project begon toen accountants het ML-team vroegen om AI te leren facturen te lezen, die in chaotische formaten binnenkwamen: oude Excel-bestanden, documenten met CID-lettertypen, Word-tabellen, meerpagina-PDF's en zelfs foto's. Het team koos voor een on-prem LLM om commercieel gevoelige gegevens binnen het bedrijf te houden en gebruikte OCR (PaddleOCR) voor scans en afbeeldingen. Een voorverwerkingsstap converteert alle invoer naar Markdown, waarbij de structuur behouden blijft, en vervolgens extraheert de LLM velden naar een JSON-contract dat integreert met 1C. Daarna volgen harde validatiecontroles: formele controles op veldtypen en -lengtes, plus onderwerpspecifieke regels voor Russische bankgegevens zoals BIK, correspondentrekening, KPP en INN-controlesommen. Het team gebruikte aanvankelijk qwen3-thinking-30b-a3b, maar schakelde voor productie over naar openai/gpt-oss-120b, waarbij een bug aan het licht kwam waarin het model rekeningnummers als getallen behandelde en voorloopnullen liet vallen. De pijplijn bereikte 100% nauwkeurigheid op de testset, en na zes maanden in productie heeft het handmatig werk verminderd en factuurverwerking versneld, met plannen om meer documenttypes te ondersteunen.
Bron: Habr — хаб ИИ —
origineel
