Wat zijn evals? Testsets en meetmomenten waarmee je controleert of een AI-toepassing doet wat hij moet. Vóór en na livegang.
Evals zijn testsets en meetmomenten waarmee je controleert of een AI-toepassing zijn taak goed doet: een verzameling voorbeeldgevallen met bekend goed antwoord, die je regelmatig tegenaan draait. Waar een gewone softwaretest één vast antwoord heeft, draait het hier om kwaliteit (voldoende samengevat, juist geclassificeerd, trouw aan de bron) en maakt de testset dat meetbaar, geen gevoelskwestie.
De set ontstaat niet uit een boek, maar uit jouw praktijk. Neem echte gevallen: vragen die klanten echt stelden, documenten zoals ze echt zijn, en vooral de lastige. De mail met twee onderwerpen, de aanvraag met ontbrekende gegevens. Leg per geval vast wat een goed resultaat is, en je hebt een toets die je kunt herhalen. Nieuwe gevallen die in productie misgaan, voeg je toe: de set groeit mee met wat de werkvloer leert.
De kracht zit in het herhalen. Draai de set vóór livegang en je weet waar je aan begint. Draai hem na elke wijziging (nieuwe instructie, nieuw model, nieuwe bron) en je ziet in cijfers of iets verbeterde, gelijkbleef of stilletjes achteruitging. Dat laatste is het belangrijkst: AI-onderdelen veranderen buiten jouw om om, en zonder evaluatie merk je een achteruitgang pas als een klant hem meldt. Met evals is de kwaliteit een getal met een datum, geen herinnering.
Wees wel eerlijk over de grens: een evalset meet wat je erin stopt. Wie alleen makkelijke gevallen opneemt, test zijn eigen geruststelling. Daarom horen de moeilijke, de vervelende en de twijfelgevallen erin, en hoort bij elk geval helder te zijn wat goed telt. Een set die niemand kan uitleggen, is geen bewijs maar decoratie.
De moeite waard zijn ze zodra een toepassing herhaald draait of op wijzigingen reageert: productietaken, werkstromen met klanten, alles wat anderen gaat gebruiken. Dan is de set het verschil tussen beheer en gokken, en betaalt hij zich terug bij de eerste modelwissel of instructieaanpassing. Ook voor het vergelijken van opties (dit model of dat, deze formulering of die) is het eerlijkste middel om niet op smaak te ruzieën maar op dezelfde gevallen te meten.
Overbodig is hij bij eenmalige experimenten die nergens productie worden: een losse test om te voelen wat een model kan, heeft aan een handjevol voorbeelden genoeg en verdient geen bouwwerk. Let ook op de valkuil van te smal meten: wie alleen op snelheid let, verliest de zorgvuldigheid uit het oog, en wie alleen op woordkeus let, mist de inhoud. Wat je waardeert in het werk, hoort ook in de set terug te komen.
In elk traject bouwen we vóór livegang een startset uit echte gevallen van jullie vloer, inclusief de gevallen die nu al lastig zijn. Die draait bij elke wijziging, en de uitslagen delen we in begrijpelijke taal: wat ging beter, wat ging achteruit, wat leverde de wijziging op. Gevallen die in productie misgaan komen in de set, zodat dezelfde fout niet stilletjes terugkomt. Zo blijft betrouwbaarheid iets wat je kunt aanwijzen, niet iets wat je moet geloven.
Minder om te starten dan mensen verwachten (een handvol goede voorbeelden maakt de eerste toets al betekenisvol) en meer naarmate de inzet groeit: tientallen voor een eerste productiegolf, en tientallen tot honderden als het volume of het risico oploopt. Belangrijker dan het aantal is de spreiding: de moeilijke gevallen, de twijfelgevallen en de soorten invoer die in de praktijk voorkomen, moeten er allemaal in zitten. Een kleine scherpe set verslaat een grote gladde.
Samen, en uit jullie praktijk. Wij brengen de methode mee en vertalen gevallen naar toetsbare vorm; jullie kennen de echte vragen, de rare inzendingen en de gevallen waar het nu misgaat. Die combinatie is precies goed: zonder jullie vloer wordt de set theoretisch, zonder onze toets wordt hij onmeetbaar. Persoonsgegevens horen er niet in. Gevallen worden geanonimiseerd voordat ze in de set belanden, en dat leggen we vast zoals bij de rest van de opzet.
Dan gaat de wijziging niet door zoals die was. Bij een scherpe afwijking zien we eerst wat er precies veranderde (welke gevallen, op welke manier) en kiezen dan: bijsturen en opnieuw toetsen, of de wijziging terugdraaien naar de vorige werkende stand. Precies daar zit de waarde: zonder set was de achteruitgang opgevallen bij een klant, nu viel hij op bij ons, vóór livegang. Een falende test is dus geen tegenslag maar het bewijs dat hij werkt.
Ze kosten voorwerk, en besparen werk aan de achterkant. De startset is meestal in beperkte tijd opgebouwd uit gevallen die jullie toch al heeft (mails, dossiers, eerdere afhandelingen) en daarna draait hij geautomatiseerd bij elke wijziging. Wat je er voor terugkrijgt is de afweging vóór livegang in plaats van de verrassing erna. We schatten de omvang per traject in op nacalculatie, met een offerte vooraf. En zeggen eerlijk dat een traject zonder set uiteindelijk duurder uitvalt.
EIGHTY8