Inference uitgelegd | EIGHTY8

Wat is inference? Het moment waarop een getraind model een antwoord berekent. Waar de kosten en de wachttijd zitten. Waarom dat je architectuur bepaalt.

Inference is het moment waarop een getraind model met nieuwe invoer een uitkomst berekent: je vraag erin, het antwoord eruit. Training gebeurt één keer; inference gebeurt bij elke aanroep en bepaalt daarmee de doorlopende kosten en de wachttijd van een AI-toepassing. EIGHTY8 ontwerpt werkstromen daarom rond de inference-stap, niet alleen rond het model.

Tussen je vraag en het antwoord zit een rekenmoment. Het model leest de invoer token voor token, rekent per stap welk vervolg het meest waarschijnlijk is en zet dat woord voor woord neer. Dat rekenmoment heet inference. De fase waarin een getraind netwerk zijn geleerde gewichten gebruikt. Alles wat een AI-toepassing voor je doet, doet hij in deze fase.

Het onderscheid met training is praktisch, niet academisch. Training is zwaar maar eenmalig; inference is licht maar oneindig vaak. Daardoor zit daar je terugkerende rekening: elke aanroep kost rekentijd, en hoe langer de invoer en de uitkomst, hoe meer. Ook de wachttijd die een gebruiker voelt, ontstaat hier. Niet in het trainen van het model, maar in het moment zelf.

Voor je architectuur betekent dat drie dingen. Stuur niet meer tekst mee dan nodig, want elke token rekent mee. Bepaal welke stappen op het moment zelf moeten en welke 's nachts in een batch kunnen. En cache waar het antwoord hergebruikbaar is. Dezelfde vraag drie keer per dag aan een model stellen is geen AI, het is verspilling.

Inference is de moeite waard wanneer de uitkomst iets toevoegt dat regels niet leveren: samenvatten, begrijpen, formuleren, classificeren van vrije tekst. Elke aanroep moet dan iets doen wat je niet goedkoper met een vaste stap had kunnen doen. Anders betaal je rekentijd voor werk dat een if-statement doet.

Het is niet de moeite waard wanneer de vraag hetzelfde antwoord honderd keer oplevert; dan hoort een cache of een vooraf gegenereerd resultaat tussen. Ook niet wanneer de wachttijd de werkstroom blokkeert terwijl niemand op het antwoord zit te wachten. Die stap hoort asynchroon. En het loont niet zonder zicht op het verbruik: een werkstroom die per ongeluk tienduizend aanroepen per dag afvuurt, is een kostenpost die niemand ziet totdat de rekening komt.

EIGHTY8 ontwerpt elke automatisering van de inference-stap uit: welke aanroepen echt nodig zijn, welke tekst erheen gaat en welke stappen direct of in batch draaien. We meten verbruik en wachttijd per werkstroom, zodat een kostenpost zichtbaar is voordat hij pijn doet. En we koppelen elke aanroep aan een controle-moment. Een model berekent, een mens beslist waar het telt.

Wat is het verschil tussen training en inference?

Training bouwt het model: voorbeelden erin, gewichten bijstellen, heel vaak herhalen, op zware hardware. Inference gebruikt het resultaat: één invoer erin, één uitkomst eruit, telkens opnieuw. De kosten verdelen zich anders. Training is een eenmalige investering, inference een terugkerende. Voor een bedrijf dat AI inzet is inference bijna het hele verhaal, want daar zit elke aanroep van je werkstroom.

Waarom bepaalt inference de kosten van een AI-toepassing?

Omdat hij bij elke aanroep rekenkracht verbruikt, en rekencapaciteit is de grondstof waarvoor je betaalt. Of dat nu een verbruiksprijs bij een aanbieder is of je eigen hardware die draait en slijt. Een lange instructie, een groot document of een breed antwoord verhogen het verbruik per keer. Daarom kijken we bij een ontwerp eerst naar hoe vaak en hoe breed een werkstroom aanroept, pas daarna naar welk model.

Kun je inference versnellen zonder het model te vervangen?

Vaak wel. De meeste winst zit niet in het model maar eromheen: kortere invoer, een strakkere instructie, caching van herhaalde vragen, en stappen die niet live hoeven, verschuiven naar een batch. Daarnaast bestaan er serverinstellingen en kleinere varianten van hetzelfde model die sneller antwoorden met weinig kwaliteitsverlies. We meten eerst waar de tijd vandaan komt. Gokken met een ander model is de laatste stap.

Gaat bij inference ook gevoelige bedrijfsdata naar buiten?

Inference is precies het moment waarop je tekst het model in gaat. Dus het is óók het privacy-moment. Wat er met die tekst gebeurt hangt af van de keuze die je vooraf maakt: bij een dienstmodel de bewaar- en gebruiksinstellingen van de aanbieder, bij zelf draaien je eigen netwerk. We leggen per werkstroom vast welke velden meemogen, hoe lang bewaard wordt en welke toepassing welke eisen heeft.

EIGHTY8