Wat is semantisch zoeken? Zoeken op betekenis in plaats van op exacte woorden. Hoe het interne documenten en kennisbanken doorzoekbaar maakt.
Semantisch zoeken is zoeken op betekenis in plaats van op letterlijke woordovereenkomst. Een vraag in eigen woorden vindt ook de alinea die het onderwerp anders benoemt, omdat vraag en tekst beide worden omgezet naar een voorstelling van hun inhoud. EIGHTY8 gebruikt het als de zoekstap onder kennisbanken en agenten die uit eigen documenten antwoorden.
Traditioneel zoeken matcht tekens: zoek je op ontslag, dan vind je documenten waarin dat woord staat. En mis je de alinea die over beëindiging van het dienstverband gaat. Semantisch zoeken werkt anders. Zowel je vraag als de tekst in de documenten wordt vertaald naar een reeks getallen die de inhoud vat. Stukken met een vergelijkbare inhoud liggen in die voorstelling dicht bij elkaar, ongeacht welke woorden ze gebruiken.
Daardoor vindt een semantische zoekstap wat een letterlijke zoekfunctie mist: synoniemen, omschrijvingen, een vraag die in het document nooit letterlijk voorkomt maar wel wordt beantwoord. Precies dat maakt het de motor onder een kennisbank of een assistent die uit eigen documenten antwoordt: de medewerker hoeft niet te gokken welk woord het handboek gebruikt. Hij stelt gewoon zijn vraag.
Een voorbeeld uit een kantoor: iemand zoekt hoe een factuur met verkeerd btw-tarief gecorrigeerd wordt. De procesbeschrijving gebruikt nergens die formulering, maar wel tariefcorrectie na verzending. Een letterlijke zoekopdracht geeft niets; de semantische stap zet de twee naast elkaar omdat de betekenis overeenkomt. Het werk dat vroeger van de collega die het document schreef afhang, zit in de zoekstap gebouwd.
Het loont als de taal van de vraag nooit gelijk is aan de taal van de bron: klanten die vrij formuleren tegenover documenten met vaste terminologie, of een archief waarin dezelfde kwestie tien keer anders benoemd staat. Ook loont het zodra zoeken niet het einddoel is maar invoer voor een volgende stap. Een antwoord dat met bronvermelding wordt geschreven.
Het loont niet als de verzameling klein en goed gestructureerd is: honderd facturen op klantnummer vind je prima met een gewone zoekfunctie of een filter. En het is geen wondermiddel tegen rommel: tegenstrijdige documenten leveren semantisch gevonden tegenstrijdigheden op. Wie niet kan benoemen welke bron leidend is, moet eerst zijn documentatie opruimen.
Bij EIGHTY8 is semantisch zoeken zelden het eindproduct; het is de zoekstap in een grotere werkstroom. We bepalen per project welke bronnen geïndexeerd worden, hoe ze vertaald worden naar hun betekenisrepresentatie, en welke drempel geldt voordat een gevonden stuk als antwoordbron mag dienen. Blijft de zoekstap leeg, dan zegt de assistent dat. In plaats van te gokken.
De zoekfunctie in je pakket controleert letter voor letter of je woord ergens staat. Semantisch zoeken vergelijkt betekenis: het vindt stukken die over hetzelfde gaan, ook als de woorden anders zijn. Vraag je naar klanten opzeggen, dan vindt gewone zoeken alleen paginas met die letters; semantisch vindt ook de alinea over beëindiging van de overeenkomst. Voor vaste waarden als klantnummers blijft de gewone zoekfunctie juist prima.
Ja, mits de onderliggende representatie van taal begrijpt. Moderne modellen zijn op veel talen getraind en vatten Nederlandse vragen en Nederlandse documenten als gelijkwaardig. Let wel op met gemengde archieven: een Nederlandse vraag vindt daardoor ook de Engelse procedureversie. Is dat ongewenst, dan bakenen we de zoekstap af op taal of bron, zodat de resultaten passen bij de gebruiker die ze leest.
De zoekstap zelf haalt alleen op wat er staat. Hij verzint niets. Wat wél kan: stukken bovenaan zetten die er op het eerste gezicht niet thuishoren, omdat de betekenis toch overlap heeft. Dat is meestal bruikbaar, soms ruis. Het misverstand ontstaat doordat de stap vaak in een AI-assistent zit: dát onderdeel kan bijverzinnen, en daarom bouwen we het met bronvermelding en een drempel voor twijfelgevallen.
Veel meer dan een mens ooit doorzoekt, maar het is geen onbeperkte chaos: de verzameling heeft beheer nodig. Wat telt is niet alleen het aantal documenten maar de samenhang. Welke bronnen leidend zijn, hoe oud ze zijn, wie ze mag wijzigen. Begin liever met een scherpe, goed onderhouden selectie dan met het hele netwerkschijf. Groeien kan altijd; opruimen achteraf is het echte werk.
EIGHTY8