dotsagent.io
Taal:Nederlands
Bouwen · tool

Agentkosten berekenen

Een agent werkt in een loop: bij elke aanroep wordt alles tot dan toe opnieuw verstuurd, samen met het nieuwste toolresultaat. Beschrijf die loop één keer en bekijk wat een taak en een maand aan taken kosten voor elk model in onze prijstabel.

Begin met een workload

Leest bestanden, past code aan en voert tests uit in een repository. Een grote systeemprompt met toolschema's, waarbij elke stap een bestand of testlog toevoegt.

Eén taak verstuurt 3.360.000 inputtokens en ontvangt 36.000 outputtokens. De grootste afzonderlijke prompt telt 199.000 tokens.

Geschatte kosten per taak en per maand voor elk model
ModelPer taak30 dagen met 50 per dag
GPT-6 Luna · OpenAI⁨US$ 0,099⁩⁨US$ 148⁩
Qwen3.7-Flash · Alibaba Cloud (Qwen)28 calls tegen het tarief voor lange prompts⁨US$ 0,101⁩⁨US$ 152⁩
GLM-5.3-Flash · Z.ai (Zhipu)⁨US$ 0,182⁩⁨US$ 273⁩
DeepSeek-V4.1-Flash · DeepSeek⁨US$ 0,218⁩⁨US$ 327⁩
Gemini 3.5 Flash-Lite · Google⁨US$ 0,333⁩⁨US$ 499⁩
Qwen3.7-Plus · Alibaba Cloud (Qwen)⁨US$ 0,343⁩⁨US$ 515⁩
Mistral Small 4 · Mistral AI⁨US$ 0,526⁩⁨US$ 788⁩
Gemini 3.8 Flash · Google⁨US$ 0,742⁩⁨US$ 1.112⁩
DeepSeek-V4-Pro-0813 · DeepSeek⁨US$ 0,961⁩⁨US$ 1.441⁩
Claude Haiku 4.5 · Anthropic⁨US$ 0,989⁩⁨US$ 1.483⁩
Amazon Nova 2 Lite · Amazonprijs van derden⁨US$ 1,10⁩⁨US$ 1.647⁩
Grok Build 0.1 · xAI⁨US$ 1,16⁩⁨US$ 1.746⁩
Muse Spark 1.3 · Meta⁨US$ 1,23⁩⁨US$ 1.852⁩
Grok 4.3 · xAI⁨US$ 1,31⁩⁨US$ 1.970⁩
Gemini 3.5 Flash · Google⁨US$ 1,54⁩⁨US$ 2.306⁩
Qwen3.8-Max · Alibaba Cloud (Qwen)⁨US$ 1,63⁩⁨US$ 2.443⁩
GLM-5.3 · Z.ai (Zhipu)⁨US$ 1,63⁩⁨US$ 2.446⁩
GPT-6.1 Sol · OpenAI⁨US$ 1,69⁩⁨US$ 2.541⁩
Claude Sonnet 5.5 · Anthropic⁨US$ 1,98⁩⁨US$ 2.966⁩
Gemini 3.1 Pro Preview · Google⁨US$ 2,05⁩⁨US$ 3.074⁩
Grok 4.7 · xAI⁨US$ 2,68⁩⁨US$ 4.026⁩
Kimi K3 · Moonshot AI (Kimi)⁨US$ 2,97⁩⁨US$ 4.449⁩
Claude Opus 5.5 · Anthropic⁨US$ 3,39⁩⁨US$ 5.082⁩
Amazon Nova 2 Pro · Amazonprijs van derden⁨US$ 4,56⁩⁨US$ 6.840⁩
Mistral Medium 3.5 · Mistral AI⁨US$ 5,31⁩⁨US$ 7.965⁩
Claude Fable 5.1 · Anthropic⁨US$ 7,76⁩⁨US$ 11.642⁩
Command A+ · Cohereoverschrijdt het contextvensterprijs van derden⁨US$ 8,76⁩⁨US$ 13.140⁩
GPT-6 Astra · OpenAI⁨US$ 9,89⁩⁨US$ 14.831⁩

Lijstprijzen, standaardtarief, Amerikaanse dollars. Kosten voor cache writes, belastingen, toolkosten zoals websearch en regionale toeslagen zijn niet inbegrepen.

Hoe de schatting werkt

Voor elke call in de loop nemen we de promptgrootte: de eerste prompt plus de groei door elke eerdere stap. We splitsen die op in een gecachet en een nieuw deel. De eerste call is altijd nieuw. Nieuwe tokens worden gefactureerd tegen het inputtarief, gecachete tokens tegen het cachetarief en output tegen het outputtarief.

Als één prompt de drempel voor lange context van een provider overschrijdt, wordt die volledige call gefactureerd tegen het tarief voor lange prompts, zoals bij OpenAI, Google, xAI en Qwen. Is de grootste prompt groter dan het contextvenster van het model, dan wordt de rij gemarkeerd. Een echte agent zou de geschiedenis eerst moeten inkorten of samenvatten.

Echte agents verschillen per taak, proberen mislukte stappen opnieuw en stoppen soms eerder. Gebruik deze cijfers om modellen voor dezelfde workload te vergelijken en meet daarna de werkelijke aantallen tokens in je eigen traces voordat je een budget opstelt.

Veelgestelde vragen over agentkosten

Hoeveel tokens gebruikt een AI-agent per taak?

Dat hangt vooral af van het aantal stappen en hoeveel elke stap toevoegt. Een kort gesprek met support kan 30K inputtokens gebruiken; een codeertaak van 30 stappen met een startprompt van 25K tokens verstuurt meer dan drie miljoen tokens, omdat bij elke call de volledige geschiedenis opnieuw wordt verstuurd.

Hoe verlaag ik de kosten van een agent?

Houd het begin van de prompt bij elke call identiek, zodat het wordt gecachet. Beperk toolresultaten tot wat het model nodig heeft, vat oude beurten samen of verwijder ze, gebruik een klein model voor routinestappen en alleen een groot model voor planning, en verlaag de redeneerinspanning waar de kwaliteit dat toelaat.

Werkt prompt caching automatisch?

Bij OpenAI, DeepSeek, Kimi en de impliciete caching van Gemini gebeurt dat automatisch als prompts een lange prefix delen. Anthropic en sommige Qwen-endpoints vereisen expliciete cachemarkers; Anthropic rekent extra kosten voor de eerste write.

Waarom is het model met de laagste kosten per token niet het goedkoopst per taak?

Cachekortingen verschillen per model, sommige providers rekenen een hoger tarief voor lange prompts en reasoning-modellen gebruiken outputtokens om na te denken. Een model dat minder stappen of retries nodig heeft, kan ook goedkoper uitvallen; deze calculator houdt daar geen rekening mee.

Onafhankelijke referentie voor iedereen die AI-agents bouwt. Niet verbonden aan een van de genoemde leveranciers.

© 2026 DotsAgent · Feiten gecontroleerd op 1 oktober 2026