Wat is chunking? Documenten opknippen in stukken die een model kan doorzoeken en lezen. Waarom de knipmethode de kwaliteit van RAG-antwoorden bepaalt.
Chunking is het opknippen van documenten in overzichtelijke stukken voordat ze doorzoekbaar worden voor een AI-systeem. Elke chunk is een afgerond geheel van enkele alinea's, zodat een antwoord precies het deel vindt dat ertoe doet. EIGHTY8 behandelt de knipregels als ontwerpbesluit, omdat slecht geknipte bronnen gekke antwoorden geven.
Een taalmodel kan geen archiefkast tegelijk lezen, en een zoekstap werkt het best met compacte stukken. Daarom wordt een document vóór gebruik opgeknipt in chunks: blokken van ongeveer een alinea tot een pagina. Die blokken worden apart geïndexeerd, en bij een vraag haalt het systeem alleen de stukken op die het meest passen. Niet het hele document.
Waar je knipt, bepaalt wat er te vinden is. Knipt je midden in een alinea of dwars door een tabel heen, dan mist een stuk zijn context: de zin over uitzonderingen is zonder de kop erboven onzin. Goede knipregels volgen de structuur van het document (koppen, paragrafen, secties) en houden tabellen en lijsten intact. Zo weet elk stuk waar hij vandaan komt en waar hij over gaat.
Een voorbeeld: een nieuwbouwbedrijf laat zijn contractvoorwaarden doorzoeken. Wordt het document in stukken van vaste lengte gesneden, dan belandt de clausule over aansprakelijkheid soms in een ander blok dan de clausule over oplevering. En antwoordt het systeem over het ene zonder het andere te zien. Knipt het systeem per artikel, dan komen beide samen op tafel. Dezelfde documenten, een andere knip, een andere kwaliteit.
Aandacht voor de knip loont zodra documenten structuur hebben die inhoud draagt: genummerde artikelen, tabellen, procedures met stappen. Dan volgt de knip de logica van het werk en vinden antwoorden hun bron. Het loont ook bij lange documenten. Een handboek van honderden pagina's is in één keer onbruikbaar, in nette stukken uitstekend doorzoekbaar.
Het is minder relevant bij korte, uniforme teksten: een doos losse mails heeft geen koppenstructuur en verdraagt een simpele knip. En het vervangt opruimen nooit: tegenstrijdige versies of verouderde documenten leveren óók netjes geknipte onzin op. Eerst de bron schoon, dan de knip. Niet andersom.
In onze RAG- en kennisbank-projecten is de knip een bewuste stap in de discovery: we kijken samen naar de echte documenten, bepalen per bron of de structuur de knip mag bepalen of dat een vaste maat beter past, en testen met de vragen die in de praktijk gesteld worden. Een chunk krijgt daarnaast altijd zijn herkomst mee (document, sectie, pagina) zodat elk antwoord zijn bron kan noemen.
Er is geen universeel formaat, want de structuur van de bron is leidend. Een procedure met genummerde stappen knip je per stap; een contract per artikel; een brief als geheel. Vuistregel: een stuk moet op zichzelf leesbaar zijn (begrijpbaar zonder de rest van het document) en klein genoeg om er een paar naast elkaar aan een model voor te leggen. We testen met jouw echte vragen en stellen de maat daarop bij.
Ja, en dat is de klassieke fout. Een alinea die uit zijn sectie gescheurd wordt, verliest zijn kop, zijn verwijzingen en zijn uitzonderingen. Het systeem vindt dan wél een match op woorden, maar de match mist de kanttekening die twee pagina's eerder stond. Daarom volgt onze knip de documentstructuur, dragen stukken hun herkomst met zich mee, en toetsen we met vragen waarvan we het juiste antwoord al kennen.
Het is een voorbereidingsstap die beide bedient, maar zijn rol kreeg hij door AI. Klassiek zoeken verdeelde documenten ook in fragmenten voor de index; wat nieuw is, is dat een taalmodel de gevonden stukken daarna daadwerkelijk leest en verwerkt in een antwoord. Daardoor zijn de eisen strenger geworden: een fragment dat voor een zoekindex nog bruikbaar was, valt als leesmateriaal voor een model tegen.
Ja, en dat stellen we ook zo voor. De knipregels zijn een afgesproken ontwerp, geen verborgen instelling: per brontype leggen we vast of de structuur leidt of een vaste maat, of tabellen intact blijven en hoeveel overlap tussen stukken zit. Verandert jouw documentensoort (een nieuw contractmodel, een ander handboek) dan passen we de regels aan en toetsen we opnieuw met echte vragen.
EIGHTY8