Wat is self-hosting van AI? Modellen op eigen of gehuurde servers draaien in plaats van via een API. Wat je wint aan controle en wat beheer je krijgt.
Self-hosting betekent dat je AI-modellen op eigen of gehuurde servers draait in plaats van ze via een API bij een provider af te nemen. Je wint controle: gegevens blijven binnen eigen muren, er is geen per-verzoek afrekening en geen provider die een dienst aanpast. Je krijgt beheer terug: hardware, updates, capaciteit en beveiliging zijn jouw zorg.
De meeste bedrijven gebruiken AI zoals ze stroom gebruiken: via een aansluiting. Een vraag gaat naar een modelprovider en er komt een antwoord terug, betaald per gebruik. Self-hosting slaat die aansluiting over: het model draait op een machine die je zelf beheert. Een server in het eigen rekencentrum of een gehuurde machine waar jij de enige gebruiker van bent. De belangrijkste reden is controle: bedrijfsgegevens verlaten de eigen omgeving niet, en niemand kan de dienst plotseling aanpassen of stopzetten.
Wat je daarvoor teruggeeft is een eerlijk rijtje. Hardware: voor degelijk werk zijn gespecialiseerde rekenkaarten nodig, en die zijn niet gratis. Beheer: het model wil geïnstalleerd, bijgewerkt en gemonitord worden, en de machine wil gemonitord, beveiligd en van stroom voorzien. Capaciteit: een model dat te groot is voor de machine, doet traag of niet; en pieken vang je op één eigen machine niet zelf op. De vergelijking met de cloud-omgeving is daarom geen voorkeursvraag maar een afweging per gebruik.
De wereld van zelfgedraaide modellen loopt vooral via open-source-modellen: vrij beschikbare modellen die je zelf op eigen hardware zet. Die zijn de afgelopen jaren sterk gegroeid en dekken voor veel taken prima de lading. Samenvatten, classificeren, zoeken in documenten. Wat ze minder goed dekken zijn de zwaarste taken, en hoe ze zich verhouden tot gesloten modellen van het hoogste niveau is per taak anders. De keuze is dus niet principieel maar praktisch: welk werk moet het doen, en welke grens accepteer je daarbij?
De moeite waard is self-hosting zodra controle de doorslag geeft: gegevens die binnen eigen muren moeten blijven, een eis dat het werk zonder internet blijft functioneren, of een belasting die zo constant en groot is dat eigen hardware zich laat terugverdienen. Ook organisaties met eigen IT-beheer (een afdeling die machines al beheert) betalen een kleinere bijkomende prijs, want het kernverschil met de cloud is niet de aankoop maar het blijvende beheer.
Het loont niet als het motief alleen kosten is: een eigen opzet lijkt op papier goedkoper, maar rekent zonder beheer en zonder dat pieken opgevangen moeten worden. Het loont ook niet voor teams zonder beheercapaciteit (een onbeheerde server is geen controle maar risico) en voor taken waar een model van het hoogste niveau nodig is, want het zelf gedraaide model haalt dat niveau niet op elke taak. Eerlijk is hier: de meeste trajecten beginnen beter in een beheerde omgeving, met self-hosting als bewuste stap zodra de belasting en de eisen dat rechtvaardigen.
We bouwen AI-toepassingen die zowel tegen een API-provider als tegen een zelf gedraaid model kunnen werken, zodat de hostingkeuze geen herbouw betekent. Zelf hosten wij geen modellen als dienst; ons eigen aanbod op dit vlak is de beheerde Cloud-PC-omgeving op de AI Development-pagina, en voor klanten met eigen infrastructuur bouwen we graag binnen die omgeving. Elke opdracht wordt vooraf gescopet en op nacalculatie afgerekend.
Op de lange termijn kan het goedkoper zijn, maar zeker niet automatisch. Bij een API betaal je per verzoek en niets anders; bij self-hosting betaal je vooral vooruit in hardware en daarna in beheer, ook in de weken dat er weinig wordt gevraagd. Bij een hoge, gelijkmatige belasting kan eigen hardware zich terugverdienen; bij een lage of wisselende belasting is de API bijna altijd voordeliger. Reken daarom met jouw eigen gebruik over een paar jaar, niet met richtgetallen.
Alleen open-source-modellen: vrij beschikbare modellen waarvan de gewichten openbaar zijn en die je op eigen hardware mag draaien. Die dekken voor taken als samenvatten, classificeren en zoeken in eigen documenten prima de lading. Gesloten modellen van de grote providers kun je niet zelf hosten. Die bestaan alleen via hun eigen dienst. Welke open variant voor jouw taak voldoet, hangt af van de taak en van de hardware die er voor staat; dat is een afweging die we in de discovery samen maken.
Voor degelijk werk zijn gespecialiseerde rekenkaarten de norm; een gewone kantoorserver komt meestal tekort zodra het werk intensiever wordt dan lichte taken. Daarnaast tellen werkgeheugen, opslag voor de modellen en koeling mee. De precieze eis hangt af van het model dat je wilt draaien en hoe snel de antwoorden moeten komen. Ons advies is bewust om eerst het gebruik te bepalen en daarna de machine te kiezen, en niet andersom. De hardware is een gevolg van de taak, niet het vertrekpunt.
Ja, en dat is een veelgebruikte combinatie: het model draait binnen eigen muren en haalt antwoorden uit jouw documenten via een zoekstap, zodat bedrijfsinformatie niet naar buiten gaat. Dat vraagt dezelfde onderdelen als elke zoek-augmented opzet. Documenten verwerkbaar maken, zoeken op betekenis, en controles op het antwoord. Het zelf draaien van het model en het werken met eigen documenten zijn twee losse keuzes; je kunt de een zonder de ander doen.
EIGHTY8