Classificatie (AI) uitgelegd | EIGHTY8

Wat is classificatie met AI? Tekst of documenten automatisch in categorieën verdelen. Mails naar de juiste afdeling, facturen naar het juiste grootboek.

Classificatie is een AI-taak waarbij elk binnenkomend item één of meer categorieën krijgt uit een vooraf afgesproken lijst: een mail naar 'factuur', 'klacht' of 'vraag'; een document naar het juiste type; een kostenpost naar het juiste grootboek. De waarde zit in de gesloten lijst. Een classificatie met open einde is geen classificatie maar een gok.

Veel handwerk in een bedrijf is stiekem hetzelfde handwerk: iets lezen en besluiten in welk hokje het hoort. Die mail gaat naar de serviceafdeling, die bijlage is een inkoopfactuur, die kostenpost hoort bij onderhoud. Classificatie automatiseert precies die beslissing: de categorieën staan vooraf vast, en voor elk binnenkomend item kiest het model uit die lijst. Eventueel met een tweede keuze en een mate van zekerheid erbij.

De kracht zit in het verschil met zelf leren lezen. Een klassiek systeem leerde per categorie uit voorbeelden en was broos bij nieuwe formuleringen; een taalmodel leest het item en kent de betekenis van woorden, dus een klacht die met een ongebruikelijke zin begint, herkent hij desondanks. Wat het model nodig heeft is heldere categorieën met duidelijke grenzen: wat telt als 'vraag' en wat als 'klacht'? Wat als beide? Die lijst en haar uitzonderingen zijn het echte ontwerpwerk. Het model is daarna het makkelijke deel.

Voorbeeld uit de mailpraktijk: een binnenkomend bericht krijgt per post een categorie (factuur, mutatie, klacht of overig) en op basis daarvan de juiste route: facturen naar de administratie, mutaties naar de planner, klachten met een markering naar de teamleider. Niemand leest meer de hele inbox om te verdelen; de mens begint bij zijn eigen hokje. Dat is de klassieke keten: eerst classificeren, daarna routeren. En de categorielijst is wat beide samenbindt.

De moeite waard is classificatie zodra verdelen een aparte handeling is geworden: iemand die elke ochtend eerst de inbox ronddeelt in plaats van zijn eigen werk doet. Hoe hoger het volume en hoe helderder de categorieën, hoe sneller het verdient. Ook bij documenten loont het: het juiste type bepalen vóór extractie voorkomt dat een factuur met het contract-antwoord wordt gelezen.

Het loont niet als de categorielijst nog niet bestaat of niet stil ligt, want een lijst die elke maand verandert, maakt elke classificatie tijdelijk. Het loont ook niet bij items die sowieso bij één persoon terechtkomen: verdelen waar niets te verdelen valt is ritueel. En een taak met twee categorieën, waarvan één klein, verdient soms liever een simpelere oplossing dan een model. Probeer eerst de vraag: valt de verdeling niet gewoon te automatiseren met een vaste regel?

We bouwen classificatie als eerste schakel in triage en documentverwerking: categorieën uit jouw praktijk, met regels voor de grijze gevallen en een doorgang naar een mens bij twijfel. In de mail-oplossing voor triage en inbox-automatisering is dit de kern; in documentverwerking bepaalt de categorie welke velden eruit komen. Trajecten worden vooraf gescopet en achteraf afgerekend op de gemaakte uren, met specificatie.

Hoeveel categorieën kan een classificatie aan?

Meer dan je denkt, maar niet oneindig: het werkvlak ligt bij een lijst die een mens nog kan overzien en uitleggen. Enkele categorieën tot een handvol tientallen. Wat knelt is niet het aantal maar de grens: categorieën die op elkaar lijken geven wisselende keuzes, en die zijn eerder te verhelpen door ze samen te voegen dan door het model te verbeteren. Begin met een lijst die vandaag klopt en laat ze meegroeien; een categorie die achteraf toegevoegd wordt, kost een regel, geen herbouw.

Wat gebeurt er met items die in geen enkele categorie passen?

Elke serieuze opzet heeft een 'overig'-uitgang, en die is geen zwakte maar ontwerp. Een item dat niet past, krijgt die categorie en gaat naar een mens. Die beslist of het echt bijzonder was of dat de lijst een categorie mist. Op die manier wordt de 'overig'-stapel een thermometer: groeit hij, dan klopt de lijst niet meer met de praktijk. Wat we vermijden is een model dat móét kiezen: gedwongen keuze tussen verkeerde categorieën is erger dan een eerlijk niet-weten.

Kan classificatie ook in meerdere talen werken?

Ja. Taalmodellen lezen categoriebetekenis in plaats van woordherkenning, dus een klacht in het Engels of Arabisch valt in dezelfde hokjes als een klacht in het Nederlands. Let wel: de categorielijst en haar uitzonderingen horen in dezelfde taal getest te worden als de echte stroom, en een tweetalige stroom vraagt een proef over beide talen. In de praktijk is meertaligheid juist een plek waar klassieke regels afhaken en taalmodellen hun voordeel laten zien.

Wat kost het om classificatie in te richten voor onze inbox?

De omvang hangt af van drie dingen: het aantal categorieën, het volume en wat er per categorie daarna moet gebeuren. Alleen verdelen is een kleine opdracht; verdelen én doorsturen naar systemen is meer werk, omdat koppelingen het eigenlijke traject zijn. We bepalen dat in de discovery, leggen de scope met aannames vast en rekenen af op de werkelijke uren. Zo betaal je voor de verdeling die je hebt, niet voor een pakket waarvan de categorieën niet de jouwe zijn.

EIGHTY8