Datakwaliteit uitgelegd | EIGHTY8

Wat is datakwaliteit en waarom bepaalt zij het succes van AI? Volledige, consistente en actuele data als voorwaarde. Wat je vooraf opruimt.

Datakwaliteit gaat over of je data bruikbaar is: volledig, consistent, actueel en zonder dubbele rijen. Voor AI bepaalt die kwaliteit direct het resultaat, want een model reproduceert de patronen die hij krijgt voorgeschoteld. Rommelige invoer levert dus geen verrassingen op, maar gewoon rommelige uitvoer. De fout wordt alleen sneller en vaker herhaald.

Vier eigenschappen bepalen of data deugt. Volledig: ontbreken er velden, dan begint een model te gokken. Consistent: heet het veld in het ene systeem anders dan in het andere, dan wordt koppelen een puzzel. Actueel: een adresbestand van jaren geleden beantwoordt vragen van vandaag fout. Uniek: een klant die tweemaal voorkomt, krijgt ook tweemaal een andere behandeling.

Het probleem is zelden één veld. De rommel zit in de naden: facturen die handmatig werden overgetypt, mailadressen die in notitievelden belandden, projectnamen die iedereen anders spelt. Een mens kijkt daar overheen, want hij vult uit ervaring aan. Een model doet dat niet. Hij neemt wat er staat, letterlijk, en schaalt het gebruik ervan tegelijk op.

Voorbeeld: een werkstroom die offerteksten samenvat, werkt uitstekend op nette documenten en levert halfzijdige samenvattingen bij scans, oude versies en ontwerpen die nooit definitief werden. De technologie faalde niet. De invoer was het niet waard. Daarom is opruimen bij elk AI-traject de eerste échte opdracht, nog vóór er een model aan te pas komt.

Altijd vóór een AI-traject, en vooral vóór je verwachtingen werkt. Een gerichte schoonmaakbeurt scheelt achteraf weken aan uitzoekwerk, omdat fouten anders in elke automatisering worden doorgerekt en telkens opnieuw worden uitgelegd. Wie data als product behandelt (met een eigenaar, duidelijke afspraken en periodieke opruimbeurten) haalt uit élke opvolgende automatisering meer dan de vorige.

Het loont níet om alle data te willen perfecten vóór je iets bouwt. Kwaliteit is per werkstroom een keuze: de documenten die in het proces meedoen verdienen aandacht, het archief van jaren terug niet. Begin waar je gaat automatiseren, niet bij het begin van alles. Perfectie in het geheel is een project dat nooit oplevert; orde in de werkstroom zelf levert vanaf dag één.

Elke discovery begint bij de bron: welke documenten en systemen voeden de werkstroom, en wat staat er echt in? We kijken samen naar ontbrekende velden, dubbele rijen en tegenstrijdigheden, en maken van tevoren helder wat de automatisering wél en niet verwerkt. Is de invoer te rommelig, dan zeggen we dat. En stellen we voor eerst te snoeien, in plaats van een model te bouwen dat de rommel gaat vermenigvuldigen.

Moeten we eerst jaren aan data opruimen voordat we met AI kunnen beginnen?

Nee, en dat is een veelgehoord misverstand. Je ruimt op wat het gekozen werkstroom nodig heeft: de documenten, velden en systemen die in het proces meedoen. Het overige archief laat je met rust totdat er een reden is om het mee te nemen. In de praktijk gaat het om een beperkte, gerichte schoonmaak. Geen years-long programma. Wie alles tegelijk wil perfecten, begint nooit; wie per stap opruimt, bouwt en leert tegelijk.

Hoe zie ik of onze datakwaliteit goed genoeg is?

Neem de werkstroom die je wilt automatiseren en toets de invoer op de vier eigenschappen: zijn de velden gevuld, heten ze overal hetzelfde, is de informatie actueel en komt elke klant of zaak maar één keer voor? Strooi er een paar willekeurige gevallen doorheen en kijk wat er ontbreekt. Ligt een documentmap ten grondslag aan het proces, controleer dan of versies herkenbaar zijn en scans een tekstlaag hebben. Twijfelachtige plekken zijn beter gevonden vóór de bouw dan erna.

Kan AI onze datakwaliteit zelf verbeteren?

Gedeeltelijk. AI is sterk in het opsporen van patronen die op rommel wijzen: dubbele rijen, tegenstrijdige adressen, velden die niet in het juiste formaat staan, documenten zonder tekstlaag. Ook het voorstellen van een normalisatie (dezelfde schrijfwijze voor elk veld) kan automatisch. Maar de beslissing over wat de juiste waarde is, blijft mensenwerk: een model kan suggereren, niet weten. Zie het dus als een hulpmiddel bij de schoonmaak, niet als de schoonmaak zelf.

Wat kost het om data op te schonen vóór een AI-traject?

Dat hangt af van hoe rommelig de invoer is en hoeveel ervan in het proces meedoet; er is geen vast tarief per veld of per map aan te geven. Vaak is de meeste winst niet eens technisch maar organisatorisch: één afspraak over hoe een veld wordt gevuld voorkomt dat de rommel terugkomt. We schatten de schoonmaak in als onderdeel van de discovery en nemen hem op in de offerte, zodat je vooraf weet waar je aan toe bent.

EIGHTY8