Agentkosten berekenen
Een agent werkt in een loop: bij elke aanroep wordt alles tot dan toe opnieuw verstuurd, samen met het nieuwste toolresultaat. Beschrijf die loop één keer en bekijk wat een taak en een maand aan taken kosten voor elk model in onze prijstabel.
| Model | Per taak | 30 dagen met 50 per dag |
|---|---|---|
| GPT-6 Luna | US$ 0,099 | US$ 148 |
| Qwen3.7-Flash28 calls tegen het tarief voor lange prompts | US$ 0,101 | US$ 152 |
| GLM-5.3-Flash | US$ 0,182 | US$ 273 |
| DeepSeek-V4.1-Flash | US$ 0,218 | US$ 327 |
| Gemini 3.5 Flash-Lite | US$ 0,333 | US$ 499 |
| Qwen3.7-Plus | US$ 0,343 | US$ 515 |
| Mistral Small 4 | US$ 0,526 | US$ 788 |
| Gemini 3.8 Flash | US$ 0,742 | US$ 1.112 |
| DeepSeek-V4-Pro-0813 | US$ 0,961 | US$ 1.441 |
| Claude Haiku 4.5 | US$ 0,989 | US$ 1.483 |
| Amazon Nova 2 Liteprijs van derden | US$ 1,10 | US$ 1.647 |
| Grok Build 0.1 | US$ 1,16 | US$ 1.746 |
| Muse Spark 1.3 | US$ 1,23 | US$ 1.852 |
| Grok 4.3 | US$ 1,31 | US$ 1.970 |
| Gemini 3.5 Flash | US$ 1,54 | US$ 2.306 |
| Qwen3.8-Max | US$ 1,63 | US$ 2.443 |
| GLM-5.3 | US$ 1,63 | US$ 2.446 |
| GPT-6.1 Sol | US$ 1,69 | US$ 2.541 |
| Claude Sonnet 5.5 | US$ 1,98 | US$ 2.966 |
| Gemini 3.1 Pro Preview | US$ 2,05 | US$ 3.074 |
| Grok 4.7 | US$ 2,68 | US$ 4.026 |
| Kimi K3 | US$ 2,97 | US$ 4.449 |
| Claude Opus 5.5 | US$ 3,39 | US$ 5.082 |
| Amazon Nova 2 Proprijs van derden | US$ 4,56 | US$ 6.840 |
| Mistral Medium 3.5 | US$ 5,31 | US$ 7.965 |
| Claude Fable 5.1 | US$ 7,76 | US$ 11.642 |
| Command A+overschrijdt het contextvensterprijs van derden | US$ 8,76 | US$ 13.140 |
| GPT-6 Astra | US$ 9,89 | US$ 14.831 |
Hoe de schatting werkt
Voor elke call in de loop nemen we de promptgrootte: de eerste prompt plus de groei door elke eerdere stap. We splitsen die op in een gecachet en een nieuw deel. De eerste call is altijd nieuw. Nieuwe tokens worden gefactureerd tegen het inputtarief, gecachete tokens tegen het cachetarief en output tegen het outputtarief.
Als één prompt de drempel voor lange context van een provider overschrijdt, wordt die volledige call gefactureerd tegen het tarief voor lange prompts, zoals bij OpenAI, Google, xAI en Qwen. Is de grootste prompt groter dan het contextvenster van het model, dan wordt de rij gemarkeerd. Een echte agent zou de geschiedenis eerst moeten inkorten of samenvatten.
Echte agents verschillen per taak, proberen mislukte stappen opnieuw en stoppen soms eerder. Gebruik deze cijfers om modellen voor dezelfde workload te vergelijken en meet daarna de werkelijke aantallen tokens in je eigen traces voordat je een budget opstelt.
Veelgestelde vragen over agentkosten
Hoeveel tokens gebruikt een AI-agent per taak?
Dat hangt vooral af van het aantal stappen en hoeveel elke stap toevoegt. Een kort gesprek met support kan 30K inputtokens gebruiken; een codeertaak van 30 stappen met een startprompt van 25K tokens verstuurt meer dan drie miljoen tokens, omdat bij elke call de volledige geschiedenis opnieuw wordt verstuurd.
Hoe verlaag ik de kosten van een agent?
Houd het begin van de prompt bij elke call identiek, zodat het wordt gecachet. Beperk toolresultaten tot wat het model nodig heeft, vat oude beurten samen of verwijder ze, gebruik een klein model voor routinestappen en alleen een groot model voor planning, en verlaag de redeneerinspanning waar de kwaliteit dat toelaat.
Werkt prompt caching automatisch?
Bij OpenAI, DeepSeek, Kimi en de impliciete caching van Gemini gebeurt dat automatisch als prompts een lange prefix delen. Anthropic en sommige Qwen-endpoints vereisen expliciete cachemarkers; Anthropic rekent extra kosten voor de eerste write.
Waarom is het model met de laagste kosten per token niet het goedkoopst per taak?
Cachekortingen verschillen per model, sommige providers rekenen een hoger tarief voor lange prompts en reasoning-modellen gebruiken outputtokens om na te denken. Een model dat minder stappen of retries nodig heeft, kan ook goedkoper uitvallen; deze calculator houdt daar geen rekening mee.