Anonimisering uitgelegd | EIGHTY8

Wat is anonimisering? Gegevens zo bewerken dat ze niet meer tot een persoon herleidbaar zijn. En het verschil met pseudonimisering.

Anonimisering betekent: gegevens zo bewerken dat niemand er nog een specifieke persoon aan kan koppelen, met geen enkel middel. Namen weglaten is niet genoeg; kenmerkcombinaties moeten óók weg of verbreed worden. Is de lat pas gehaald, dan valt de AVG buiten spel. EIGHTY8 zet hem vooral in voor testdata, evaluaties en logs.

Anonieme gegevens zijn gegevens waaraan niemand meer herkend wordt. Niet door het team, niet door een derde partij, niet door een patroon dat een toevallige combinatie verraden zou kunnen zijn. Die lat is hoger dan hij klinkt. Namen, telefoonnummers en klantnummers verwijderen is slechts de eerste stap; een record met postcode, geboortemaand en beroep kan daarna nog maar tot weinig mensen leiden, en met een extra bron misschien tot één. Anonimiseren betekent dus ook: kenmerken verbreden, combineren weghalen, of rijen die te bijzonder zijn laten vallen.

Het verschil met pseudonimisering is de sleutel. Pseudonimiseren vervangt de naam door een code, maar bewaart ergens een koppeling die de oorspronkelijke persoon teruggeeft. De gegevens blijven persoonsgegevens, alleen beter beveiligd. Anonimiseren gooit die brug weg: er bestaat geen koppeling meer, en daarmee valt de verzameling buiten de reikwijdte van de AVG. Dat is een groot voordeel, en precies daarom geen claim die je licht maakt.

In AI-projecten vinden wij anonimisering vooral een plek op twee velden. Testdata: evaluaties en proefopstellingen draaien op verzamelingen die geen echte personen bevatten, zodat een fout geen schade doet. En logs: wat bewaard wordt om fouten te kunnen herleiden, bevat voldoende om het probleem te vinden en niet meer om de gebruiker te kennen. Voor de eigenlijke productie-aanroepen met klantgegevens is pseudonimiseren of minimaliseren meestal de betere weg, omdat de herleidbaarheid daar juist nodig blijft voor de dienstverlening zelf.

De moeite waard is hij op plekken waar de taak het patroon nodig heeft maar de persoon niet: testsets voor een classificatie, oefenmateriaal voor een demo, statistische rapportages over gebruik. Ook voor bewaring op lange termijn loont hij: een log of historie die anoniem is, is een archief zonder risico. En hij maakt gesprekken met klanten eenvoudiger. 'de voorbeelden bevatten geen persoonsgegevens' is een zin die het gesprek beëindigt in plaats van opent.

Niet de moeite waard is hij waar de herleidbaarheid de dienst úitmaakt: een order moet terug te leiden zijn naar een klant, anders kan er niet geleverd, gefactureerd of gereageerd worden. Daar is anonimiseren geen bescherming maar slopen van het werk. En hij is geen stempel die je erop drukt: verzamelingen groeien en combineren zich, dus een anonime set kan bij nieuwe bronnen weer herleidbaar worden. Behandel de aanname als levend, en toets hem als de verzameling verandert.

Wij gebruiken anoniem gemaakte of kunstmatige data voor tests, evaluaties en demo's, en letten bij logs op wat bewaard blijft. Waar een klant testdata wil die op de werkelijkheid lijkt, bouwen we die liever aan dan echte dossiers te ontkleden. Het resultaat is bruikbaar zonder dat er iemand achterblijft in de kopie. Over de strengere keuzes rond echte persoonsgegevens adviseren we eerlijk over de grenzen van wat wij als engineer kunnen beoordelen.

Wanneer zijn gegevens echt anoniem?

Als herleiding redelijkerwijs voor niemand meer mogelijk is. Niet alleen voor jouw team, maar met alle middelen die redelijkerwijs ingezet kunnen worden, inclusief koppeling met andere bronnen. Namen weghalen volstaat dus niet: postcode, geboortemaand en beroep samen kunnen een persoon al bijna uniek maken. De toets is streng en hangt af van de context; wie zich op anonimiteit beroept, doet er goed aan die afweging te laten maken door wie daarin bevoegd is, en de kenmerken die herleiding mogelijk maken breed te verbreden of weg te halen.

Kan een AI-model anonieme gegevens terugbrengen tot personen?

Een model herstelt geen weggegooide koppeling. Die bestaat niet meer en kan niet worden verzonnen. Wat wél kan gebeuren: een verzameling die anoniem leek, wordt met nieuwe bronnen toch herleidbaar, en een taalmodel dat anonieme teksten samenvat kan een verhaal zo kenmerkend laten blijven dat wie de situatie kent, de persoon herkent. Daarom verbreden we bij het anonimiseren ook kenmerken die het verhaal uniek maken, en niet alleen de namen erin.

Valt geanonimiseerde data nog onder de AVG?

Nee, zolang de herleidbaarheid werkelijk weg is: de AVG geldt voor persoonsgegevens, en echt anonieme informatie valt buiten het bereik. Dat is precies de aantrekkingskracht. Een anonieme testset mag delen, bewaren en hergebruiken zonder bewaartermijnen en verwerkersafspraken. De keerzijde: de claim moet kloppen, en hij is contextafhankelijk. Behandel 'anoniem' dus als een toets die je kunt onderbouwen, niet als een label dat op een map geplakt wordt.

Hoe maak ik testdata anoniem voor een AI-project?

Twee wegen werken goed. De eerste is bewerken: namen, nummers en kenmerken verwijderen of verbreden tot ze niet meer tot een persoon leiden, en rijen die te bijzonder blijven laten vallen. De tweede is vervangen: kunstmatige voorbeelden genereren die de structuur van de echte data volgen (dezelfde velden, hetzelfde type taal) zonder dat er iemand achter zit. Voor evaluaties en demo's kiezen wij vaak de tweede weg: hij is op te schalen en er blijft per definitie niemand in achter.

EIGHTY8