Documentextractie uitgelegd | EIGHTY8

Wat is documentextractie? Gestructureerde gegevens uit ongestructureerde documenten halen en in je systeem zetten. Hoe je fouten opvangt met controle.

Documentextractie is het automatisch halen van afgesproken velden uit documenten (het bedrag uit een factuur, het ordernummer uit een bevestiging, de opzegtermijn uit een contract) en het wegschrijven van die velden in een systeem. De invoer is ongestructureerd, de uitvoer is een nette rij gegevens die software verder kan verwerken.

De meeste bedrijfsinformatie begint haar leven in een document dat voor mensen is geschreven: een offerte, een aanvraag, een bevestiging, een formulier. Zo'n document is voor een administratie onbruikbaar totdat iemand de kern eruit pikt en in het systeem zet. Documentextractie is dat oppikken, geautomatiseerd: er wordt vooraf een veldenlijst afgesproken, en bij elk binnenkomend document worden precies die velden gelezen en overgezet.

De stap bestaat uit drie onderdelen die elk hun eigen aandacht vragen. Lezen: het document wordt omgezet in tekst, met OCR als dat nodig is. Begrijpen: de gevraagde velden worden in die tekst gevonden. Tegenwoordig meestal door een taalmodel dat het document leest en de waarden benoemt. Wegschrijven: de waarden worden aan regels getoetst en in het juiste systeem gezet, met een plek voor wat niet lukt. De derde stap is de minst glamorous en de bepalende: extractie zonder wegschrijf- en controlestap is een demo.

Een voorbeeld: een vastgoedbeheerder ontvangt huurcontracten, indexeringsbrieven en onderhoudsrapportages als bijlagen. Vooraf is afgesproken welke velden eruit moeten. Adres, ingangsdatum, indexatiepercentage, vervolgdatum. Bij elk document leest de extractie die velden en zet ze in het beheersysteem; valt een waarde buiten zijn verwachting, dan komt het document in een controlelijst voor een mens. Dat is het patroon dat extractie bruikbaar maakt: automatisch waar het kan, gemarkeerd waar het twijfelachtig is.

De moeite waard is documentextractie zodra dezelfde velden regelmatig uit wisselende documenten worden overgetypt: debiteuren- en crediteurenadministratie, dossiervorming, inname van aanvragen of contracten. Hoe wisselender de documenten eruitzien, hoe groter het verschil met een vaste template. Ook in processen waar vertraging duur is loont hij: een aanvraag die dezelfde dag klaarligt in het systeem in plaats van in een inbox.

Het loont niet als de veldenlijst er niet is of per keer verandert. Extractie zonder afgesproken velden is niets. Het loont ook niet bij documenten waarvan de inhoud al gestructureerd is: een csv of een api-antwoord heeft geen extractie nodig. En wees eerlijk over de randen: een document dat half onleesbaar is, levert half gevulde velden op. Die vallen op via de controle, maar verdwijnen niet door het model erbij te halen.

Onze extractie loopt altijd in een kader: veldenlijst uit de discovery, leesstap, begrijpstap, regels die onmogelijke waarden afwijzen, en een controlelijst voor wat de machine laat liggen. De uitvoer schrijft in het systeem dat er al staat, niet in een nieuw eiland. Hoe dat er als oplossing uitziet, staat op de documentextractie-met-ai-pagina; hoe een menselijke controle daar in past, staat bij human-in-the-loop. Opdrachten worden gescopet en afgerekend op de werkelijk gemaakte uren, met specificatie.

Welke velden kan documentextractie uit een document halen?

Alles wat op het document met een zekere regelmaat staat: datums, bedragen, nummers, namen, adressen, statussen, bedragen per regel, en ook samengestelde waarden zoals een totaal dat uit regels bestaat. De grens zit niet in het type veld maar in de herkenbaarheid: een veld dat op elk document anders heet of er per leverancier anders uitziet, is haalbaar maar vraagt meer controle. We stellen de veldenlijst vooraf op samen met jou, met voor elk veld een bron op het document waar de waarde vandaan komt.

Hoe voorkom je dat foute waarden ons systeem in gaan?

Met lagen in plaats van met hoop. Laag één: harde regels die onmogelijke waarden weigeren. Verkeerde datumnotatie, een bedrag dat niet optelt, een leeg verplicht veld. Laag twee: een vertrouwenschatting per veld, waarbij twijfelachtige waarden niet doorgaan maar op een controlelijst belanden. Laag drie: periodieke steekproeven op de velden die het hardst tellen, zoals bedragen. Zo wordt fout in plaats van stil het standaardscenario: een gemarkeerd document is een taak, een stil fout bedrag is schade.

Wat is het verschil tussen documentextractie en document-AI?

Ze overlappen grotendeels en worden vaak door elkaar gebruikt. Document-AI is het geheel: documenten lezen, classificeren en begrijpen met AI. Documentextractie is de concrete handeling die daaruit volgt: de afgesproken velden uit een document halen en wegschrijven. Praktisch gezegd is extractie de uitkomst en document-AI een van de middelen. Naast templates en vaste regels die bij simpele, stabiele stromen nog steeds prima werken.

Waar wordt de geëxtraheerde data opgeslagen?

In het systeem waar hij thuishoort: je administratie, je CRM, je beheersysteem of je dossieromgeving. We bouwen geen nieuw eiland dat naast je bestaande pakketten staat; de extractie schrijft via een koppeling weg in wat er al is. Wel leggen we vast waar tussenstappen bewaard worden (de gelezen tekst, de waarden vóór controle) en hoe lang die bewaard blijven. Dat is een privacykeuze die we in de discovery met je maken, niet een instelling die ergens achteraf opduikt.

EIGHTY8