Wat is document-AI? AI die documenten leest, classificeert en de juiste velden eruit haalt. Van factuur tot contract. Zo werkt de stap na OCR.
Document-AI is AI die documenten niet alleen leest maar begrijpt: hij herkent welk soort document het is, haalt de relevante velden eruit en zet ze in een bruikbare structuur. Een inkoopfactuur wordt zo leverancier, bedrag en vervaldatum; een contract wordt partijen, looptijd en opzegtermijn. Het is de begrijp-laag bovenop tekstherkenning.
Een document is voor een administratie pas waardevol als zijn inhoud in velden staat. Mensen lezen een document en zeggen zonder na te denken: dit is een factuur, dit is het bedrag, dit is de klant. Precies dat doen document-AI-modellen: ze nemen een document (scan, pdf of bijlage) en leveren een antwoord in structuur, in plaats van een lap tekst. De stap bestaat uit drie delen: het document binnenhalen en leesbaar maken, bepalen wat voor soort document het is, en de gevraagde velden eruit halen met een controle erna.
Het verschil met klassieke tekstherkenning zit in die derde stap. Tekstherkenning geeft woorden; document-AI geeft betekenis, omdat het model taal en context meeleest. Dat werkt ook bij variatie: een factuur van leverancier A ziet er anders uit dan die van leverancier B, en een model herkent het veld desondanks, omdat het het document leest in plaats van een vast patroon aftelt. Klassieke templates doen dat niet. Een template breekt zodra een leverancier zijn lay-out wisselt.
Twee voorbeelden uit het dagelijkse werk. Eén: postvak in, wisselende bijlagen (het model bepaalt per stuk of het een factuur, een aanmaning of iets anders is, en haalt bij een factuur de betaalgegevens eruit voor de administratie). Twee: contracten bij inname (het model leest partijen, ingangsdatum en opzegtermijn en zet ze in het dossier, zodat opvolging niet afhangt van iemands geheugen). In beide gevallen geldt: de uitvoer gaat mét controle het systeem in, niet zonder.
De moeite waard is document-AI zodra documenten in volume binnenkomen en iemand ze handmatig overtypt, sorteert of controleert: inkoop, debiteuren, postverwerking, dossiervorming. Hoe wisselender de vormgeving, hoe groter het voordeel ten opzichte van templates. Ook loont hij waar snelheid meetbaar is: een claim of aanvraag die op de dag zelf verwerkt wordt in plaats van in de wachtrij.
Het loont niet bij kleine, stabiele stromen met één vaste vorm. Dan is een eenvoudige koppeling of template goedkoper en net zo betrouwbaar. En hij is geen vergunning om controles over te slaan: een model leest overtuigend fout als het bronmederland rommelig is, en een verkeerd gelezen bedrag is erger dan een onverwerkt document. Wie document-AI aanschaft, koopt een snelle lezer; de eindcontrole door een mens of door harde regels hoort er bewust bij.
We bouwen document-AI als deel van een werkstroom: binnenkomen, lezen, extraheren, controleren, wegschrijven in het systeem dat er al staat. Welke velden eruit komen en wie de uitzonderingen afvangt, leggen we in de discovery vast. De oplossingsvorm staat op de pagina documentextractie-met-ai beschreven. Elk traject schieten we vooraf in met een scherpe scope; de afrekening loopt over het werk dat werkelijk is gedaan, met specificatie erbij.
Alles waarvan de inhoud in velden thuishoort en dat in aantallen binnenkomt: facturen, bestelformulieren, aanvragen, polissen, contracten, LOI's, formulieren met handtekeningen, bijlagen bij mail. Minder geschikt zijn losse correspondentie zonder vaste betekenis per regel, en documenten waarvan niemand kan uitleggen welke velden eruit moeten komen. Die laatste categorie is het eerlijkste signaal: zonder duidelijke veldenlijst is document-AI een duur leesvoorstel in plaats van een werkstroom.
Dat gebeurt, en het ontwerp moet daarop rekenen. We bouwen drie vangnetten: harde regels die onmogelijke waarden weigeren. Een datum in de toekomst bij een inkoopfactuur, een totaal dat niet klopt met de som van de regels; een vertrouwenscore per veld, waarbij lage scores naar een mens gaan; en een steekproef of volledige controle op de velden die gelden. Zo wordt een verkeerde lezing een gemarkeerde uitzondering in plaats van een stil geboekt bedrag. De kans op fouten maak je klein, de gevolgen ervan beheersbaar.
Ja, en dat is zijn voornaamste voordeel boven templates. Een model leest het document als taal en herkent het veld ondanks andere vormgeving, andere volgorde of een andere taal. Er is een grens: extreem afwijkende of zelfontworpen documenten blijven lastiger dan nette bedrijfsdocumenten, en een leverancier die per maand zijn lay-out wisselt maakt het iedereen moeilijk. In de praktijk betekent dat: geen templates meer bijwerken per leverancier, maar wel een controle die blijft staan op de velden die er echt toe doen.
Dat hangt af van het aantal documenten per periode, het aantal velden dat eruit moet en het aantal systemen waar ze heen schrijven. Een stroom met één documenttype en vijf velden is een andere opdracht dan tien typen met koppelingen naar drie pakketten. Wij bepalen die omvang in de discovery, schieten het traject vooraf in met scope en aannames, en rekenen af op de gemaakte uren. Zonder pakketten en zonder richtgetallen die nergens op slaan.
EIGHTY8