← Alle inzichten
Leiders

AI-kosten beheersen begint met zichtbaarheid

AI-budgetten lopen niet uit de hand door foute beslissingen, maar door gebrekkige zichtbaarheid. Zo bouwt u controle op token-kosten voordat de factuur u verrast.

Voor wie? CTO’s, IT-managers en operationeel verantwoordelijken die AI-projecten in productie hebben of er naartoe willen — en die merken dat de kosten minder voorspelbaar zijn dan verwacht.

Kort: AI-budgetten worden zelden overschreden door een verkeerde strategische keuze. Ze lopen uit de hand omdat token-kosten een ander model volgen dan licenties, en omdat de meeste teams pas per kwartaal rapporteren terwijl de meter per seconde tikt. De organisaties die AI-kosten structureel beheersen, meten per use case en per dag. Hoe dat eruitziet in de praktijk — en welke hefbomen het meest opleveren — werkt u hands-on uit in de workshop voor leaders.


Stel dat uw team vorige maand twee nieuwe AI-toepassingen in productie nam. De sprint liep goed, de demos overtuigden, de uitrol ging vlot. Aan het eind van de maand opent u het factuuroverzicht van uw API-provider — en het getal verrast u.

Dat is geen zeldzame situatie. Het is het patroon.

LLM-kosten zijn variabel en afhankelijk van gebruik: u betaalt per token, niet per licentie. Elke aanroep kost een bedrag dat afhangt van het model dat u kiest, hoeveel tekst u meestuurt als context, en hoeveel tekst het model teruggeeft als antwoord. Dat klinkt eenvoudig. Maar in een organisatie waar meerdere teams experimenteren en bouwen, stapelen die aanroepen zich op op een manier die zonder goede meting onzichtbaar blijft totdat u rapporteert.

De oplossing is niet het terugschroeven van AI-gebruik. Ze is zichtbaarheid bouwen voordat u schaalt.

Wat token-kosten anders maakt dan licenties

Bij traditionele software betaalt u een vaste prijs per seat of per module. Gebruik stijgt — de factuur stijgt niet. Bij een LLM-API is dat verband direct: meer gebruik, hogere factuur. En het verband is niet altijd lineair.

Twee mechanismen vergroten dat effect. Ten eerste schaalt de prijs met contextlengte: hoe meer tekst u meestuurt bij elke aanroep — vorige berichten, achtergrondinfo, lange systeemprompts — hoe hoger de kosten per aanroep. Een prototype dat per gebruiker tien berichten afhandelt, kost bij honderd gelijktijdige gebruikers niet tien keer meer als de context ook tien keer langer wordt: het kost honderd keer meer. Ten tweede is er het verschil tussen input en output: input tokens zijn goedkoper dan output tokens. Een lange systeemprompt kost minder dan een even lang antwoord.

Dat betekent dat een prototype dat vijf euro per maand kost, bij productieschaal niet vijftig euro kost maar vijfhonderd — of meer. Dat is geen slechte schatting, het is gewoon wat er gebeurt als u de contextlengte niet meerekent bij de extrapolatie.

De vier kostendrijvers die u kunt aanpakken

Niet alle kostengroei is uw schuld. Maar een groot deel is vermijdbaar als u weet waar u moet kijken.

Modelselectie. Het duurste model voor elke taak inzetten is de meest voorkomende oorzaak van onnodige kosten. Voor classificatie, samenvatting en routingtaken volstaat een goedkoper model. Het dure model reserveert u voor generatie, redenering en complexe beslissingen. Die splitsing — model routing — is één van de hoogste-ROI-aanpassingen die u kunt maken zonder de kwaliteit te raken.

Contextlengte. Onnodig lange systeemprompts en het meesturen van alle eerdere berichten bij elke aanroep zijn stille kostenverhogers. Twee aanpakken helpen hier. Prompt caching: als uw systeemprompt elke aanroep hetzelfde is, kunt u die opslaan — de grote API-providers ondersteunen dit en het bespaart typisch vijftig tot tachtig procent op systeempromptkosten. RAG in plaats van lange context: stuur niet het hele document mee, maar alleen de relevante fragmenten die u via een zoekstap ophaalt. Embedding-modellen, die zoeken en classificeren, zijn een ordegrootte goedkoper dan chat-modellen.

Retries zonder diagnose. Een mislukte API-aanroep automatisch drie keer herhalen zonder te weten waarom hij mislukte, verdrievoudigt de kosten van elke fout. Een korte diagnose voor de retry — time-out of inhoudelijke fout? — bespaart meer dan hij kost.

Geen scheiding dev/prod. Testomgeving en productie delen dezelfde API-sleutel en hetzelfde budget: testkosten stapelen zich op bij productiekosten, en u ziet niet meer wat echte gebruikskosten zijn.

Zichtbaarheid bouwen: drie stappen

U kunt morgen beginnen zonder een nieuw platform of een extern bureau.

Stap één: logboek elke API-aanroep als gestructureerde data. Tijdstip, model, input tokens, output tokens, use case, omgeving (dev of prod). Niet als platte tekstregel, maar als doorzoekbaar record. Dit is de basis van alles wat volgt.

Stap twee: groepeer kosten per use case, niet per team of per maand. “Facturenverwerking” en “klantmailbeantwoording” zijn aparte use cases met aparte kostenprofielen. Aggregeren over teams verbergt welke toepassing duur is en welke niet.

Stap drie: stel dagelijkse budgetalerts in bij uw API-provider. OpenAI, Anthropic en Google hebben allemaal spending alerts. Gebruik ze. Een wekelijkse rapportage van de vijf duurste use cases × token-efficiëntie geeft u een stuurinstrument in plaats van een factuurverrassing.

De juiste ROI-vraag

Zodra u zichtbaarheid heeft, verschuift de vraag. Niet: “Hoeveel kost AI?” Maar: “Hoeveel kost de taak die AI uitvoert, versus de manier waarop u die taak nu aanpakt?”

Dat vereist dat u de basislijn kent vóór u AI inzet. Een agent die tweehonderd facturen per dag verwerkt aan twee eurocent per factuur kost vier euro per dag. Als de huidige aanpak twee uur medewerkerscapaciteit vraagt aan dertig euro per uur kost die taaknegentien euro per dag meer. ROI is in dat geval duidelijk — maar alleen omdat u de basislijn gemeten heeft.

Zonder die basislijn weet u niet of AI goedkoop is. U weet alleen wat het kost.

Het moment om te meten is nu

Zolang u nog klein bent — weinig gebruikers, weinig aanroepen — is de kost van gebrekkige zichtbaarheid laag. Dat is precies waarom teams het uitstellen. Maar de patronen die u nu instelt, bepalen of u bij schaal grip houdt of reactief bijstuurt.

Meten per use case, dagelijkse alerts, een gestructureerd logboek: dat is geen groot project. Het is een keuze die u maakt voordat de factuur de keuze voor u maakt.


Wilt u deze aanpak hands-on toepassen op uw eigen AI-portfolio? In de workshop voor leaders werkt u een dag lang aan kostenstructuur, ROI-berekening en governancemodel voor uw specifieke context.