PII (persoonsgegevens) uitgelegd | EIGHTY8

Wat is PII? Gegevens die een persoon identificeren, van naam tot IP-adres. Waarom je ze uit prompts, logs en trainingsdata houdt of afschermt.

PII (persoonsgegevens) omvat alle gegevens die naar een persoon kunnen verwijzen: naam en adres, maar ook klantnummer, IP-adres of een herkenbaar verhaal in een vrije tekstveld. Onder de AVG hebben die gegevens bescherming nodig, dus ook op het moment dat een AI-systeem ze raakt. EIGHTY8 ontwerpt werkstromen waarin PII standaard beperkt en bewaakt meedoet.

De voor de hand liggende voorbeelden kent iedereen: naam, adres, geboortedatum, burgerservicenummer. De AVG gaat verder dan dat. Alles wat naar een natuurlijke persoon kan verwijzen, direct of door te combineren, is persoonsgegeven. Een klantnummer is er een, het IP-adres van een bezoeker, de combinatie van postcode en huisnummer, en een los verhaal in een klacht waarin iemand zich herkenbaar beschrijft.

Twee voorbeelden die bedrijven vaak vergeten: het IP-adres in de logbestanden van een webwinkel, en de vrije tekstvelden in formulieren, mail en tickets. Precies de velden waar mensen uit eigen beweging schrijven wie ze zijn, waar ze wonen en waar ze boos over zijn. Juist die velden belanden ongemerkt in AI-aanroepen, samenvattingen en logs, omdat ze geen vast veld hebben met een naam.

Voor AI-projecten volgt daar een ontwerpregel uit: weet per stap welke PII meedoet. De prompt die een model krijgt, de logbestanden waarin aanroepen bewaard worden, de voorbeelden waarmee een toepassing getest wordt. Elk van die plekken verdient een blik. Waar PII nodig is voor de taak, wordt hij beperkt en beveiligd; waar hij niet nodig is, blijft hij weg. En waar herkenbaarheid niet nodig is maar het verhaal wel, kan pseudonimiseren of anonimiseren een brug zijn.

Extra telt hij bij werkstromen die automatisch en op grote schaal draaien: duizenden tickets, mails of formulieren per week. Één veld dat vergeten wordt, wordt dan duizend keer vergeten. Ook bij externen telt hij zwaar: gaat de output naar een modelprovider, dan gaat de PII mee de keten in, en hoort die keten onder afspraken. En bij gevoelige categorieën. Gezondheid, overtuiging, strafrechtelijk. Geldt een strenger regime nog eens daarbovenop.

Niet elk AI-project raakt PII: documentatie doorzoeken, voorraad plannen, productinformatie samenvatten. Daar zit geen persoon in de gegevensstroom. Wie dat van tevoren benoemt, scheelt zichzelf het hele gesprek. De simpelste vorm van bescherming blijft het niet meenemen, en dat begint bij weten waar personen in jouw gegevens zitten.

In de discovery brengen we per werkstroom in kaart waar persoonsgegevens opduiken. Inclusief de vrije tekstvelden die vaak vergeten worden. Vervolgens beperken we de veldenlijst tot wat de taak vraagt, kiezen we waar nodig pseudoniemen of anonimisering, en leggen we vast welke velden nooit de keten naar een model in gaan. Bewaking zit in het ontwerp, niet in een belofte na afloop.

Is een klantnummer ook persoonsgegeven?

Ja. Een klantnummer verwijst op zichzelf niet naar een naam, maar in combinatie met jouw administratie leidt hij rechtstreeks naar één persoon. En precies dat maakt hem onder de AVG tot persoonsgegeven. Hetzelfde geldt voor orderreferenties, medewerkerscodes en ip-adressen. De toets is niet of de code voor een buitenstaander leesbaar is, maar of jij of jouw partijen de schakel kunnen leggen. Behandel nummers dus als namen: beperkt meesturen, beveiligd bewaren.

Welke persoonsgegevens worden vaak vergeten in AI-projecten?

Twee categorieën lopen eruit. De eerste is het IP-adres in logs en statistieken, want het wordt als technisch detail weggezet terwijl het een persoonsgegeven is. De tweede zijn de vrije tekstvelden: berichten, klachten, opmerkingenvelden en de handtekeningblokken in mail, waarin mensen uit zichzelf herkenbare informatie schrijven. Vaste velden beheer je met een lijst; vrije tekst vraagt om een ontwerpkeuze: eruit filteren, afschermen of bewust meenemen met afspraken.

Mag PII naar een AI-model worden gestuurd?

Ja, mits de verwerking klopt: er is een rechtsgrond, de velden die meegaan zijn beperkt tot wat de taak vraagt, er staat een bewaartermijn op en de provider valt onder een verwerkersovereenkomst waarin bewaren en trainen geregeld zijn. Daarnaast zijn er ontwerpmiddelen die het gesprek makkelijker maken: velden verwijderen vóór de aanroep, pseudoniemen gebruiken met een aparte koppelingstabel, en de output filteren vóórdat hij een klant bereikt. Zo werkt het met persoonsgegevens zonder dat het een riskant geheim wordt.

Wat is het verschil tussen PII en gevoelige persoonsgegevens?

Gevoelige persoonsgegevens zijn een aparte, strenger beschermde categorie binnen de PII: gegevens over gezondheid, ras of etnische afkomst, godsdienst, seksuele leven of gerichtheid, vakbondslidmaatschap en strafrechtelijke gegevens. Die mogen alleen onder scherpere voorwaarden verwerkt worden. Voor een AI-project betekent het verschil concreet: normale PII kan vaak beperkt en beveiligd meedoen; gevoelige categorieën laten we buiten de werkstroom, tenzij daar een beoordeling door een jurist aan ten grondslag ligt.

EIGHTY8