dotsagent.io
Taal:Nederlands
Bouwen · prijzen gecontroleerd op 1 October 2026

Modellen en API-prijzen voor agentbouwers

Een agent betaalt voor elke stap die hij zet, en het grootste deel van die kosten komt van input die hij al eerder heeft verstuurd. In deze tabel staan lijstprijzen, cachekortingen en contextlimieten naast elkaar, zodat u een model kunt kiezen op basis van de kosten van een volledige taak, niet van de prijs die op het eerste gezicht opvalt.

Alle modellen in één tabel

API-lijstprijzen van modellen voor het bouwen van agents
Provider
GPT-6 Astra
gpt-6-astra
OpenAI⁨US$ 10⁩*⁨US$ 1⁩⁨US$ 50⁩1,05M2026-09-08
Claude Fable 5.1
claude-fable-5-1
Anthropic⁨US$ 10⁩⁨US$ 0,25⁩⁨US$ 50⁩1M2026-09-01
Claude Opus 5.5
claude-opus-5-5
Anthropic⁨US$ 4⁩⁨US$ 0,20⁩⁨US$ 20⁩1M2026-09-22
Kimi K3
kimi-k3
Moonshot AI (Kimi)⁨US$ 3⁩⁨US$ 0,30⁩⁨US$ 15⁩1,05M2026-07-16
Command A+prijs van derden
command-a-plus-05-2026
Cohere⁨US$ 2,50⁩—⁨US$ 10⁩128K2026-05-20
GPT-6.1 Sol
gpt-6.1-sol
OpenAI⁨US$ 2⁩*⁨US$ 0,10⁩⁨US$ 10⁩1,05M2026-09-29
Claude Sonnet 5.5
claude-sonnet-5-5
Anthropic⁨US$ 2⁩⁨US$ 0,20⁩⁨US$ 10⁩1M2026-09-28
Gemini 3.1 Pro Previewpreview
gemini-3.1-pro-preview
Google⁨US$ 2⁩*⁨US$ 0,20⁩⁨US$ 12⁩1,05M2026-02-19
Grok 4.7
grok-4.7
xAI⁨US$ 2⁩*⁨US$ 0,50⁩⁨US$ 6⁩500K2026-09-21
Qwen3.8-Max
qwen3.8-max
Alibaba Cloud (Qwen)⁨US$ 1,65⁩⁨US$ 0,21⁩⁨US$ 4,95⁩1M2026-08-03
Gemini 3.5 Flash
gemini-3.5-flash
Google⁨US$ 1,50⁩⁨US$ 0,15⁩⁨US$ 9⁩1,05M2026-05-19
Mistral Medium 3.5
mistral-medium-3-5
Mistral AI⁨US$ 1,50⁩—⁨US$ 7,50⁩256K2026-04-28
GLM-5.3
glm-5.3
Z.ai (Zhipu)⁨US$ 1,40⁩⁨US$ 0,26⁩⁨US$ 4,40⁩1M2026-08-14
DeepSeek-V4-Pro-0813
deepseek-v4-pro
DeepSeek⁨US$ 1,32⁩⁨US$ 0,044⁩⁨US$ 3,96⁩1M2026-08-13
Grok 4.3
grok-4.3
xAI⁨US$ 1,25⁩*⁨US$ 0,20⁩⁨US$ 2,50⁩1M—
Muse Spark 1.3
muse-spark-1.3
Meta⁨US$ 1,25⁩⁨US$ 0,15⁩⁨US$ 4,25⁩1M2026-09-02
Amazon Nova 2 Propreviewprijs van derdenAmazon⁨US$ 1,25⁩—⁨US$ 10⁩——
Claude Haiku 4.5
claude-haiku-4-5-20251001
Anthropic⁨US$ 1⁩⁨US$ 0,10⁩⁨US$ 5⁩200K—
Grok Build 0.1
grok-build-0.1
xAI⁨US$ 1⁩*⁨US$ 0,20⁩⁨US$ 2⁩256K—
Gemini 3.8 Flash
gemini-3.8-flash
Google⁨US$ 0,75⁩⁨US$ 0,075⁩⁨US$ 3,75⁩1,05M2026-09-02
Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite
Google⁨US$ 0,30⁩⁨US$ 0,030⁩⁨US$ 2,50⁩1,05M2026-07-21
DeepSeek-V4.1-Flash
deepseek-flash
DeepSeek⁨US$ 0,30⁩⁨US$ 0,006⁩⁨US$ 1,20⁩1M2026-09-10
Amazon Nova 2 Liteprijs van derdenAmazon⁨US$ 0,30⁩—⁨US$ 2,50⁩1M2025-12-02
Qwen3.7-Plus
qwen3.7-plus
Alibaba Cloud (Qwen)⁨US$ 0,28⁩*⁨US$ 0,056⁩⁨US$ 1,10⁩1M2026-05-26
Mistral Small 4
mistral-small-2603
Mistral AI⁨US$ 0,15⁩—⁨US$ 0,60⁩256K2026-03-16
GLM-5.3-Flash
glm-5.3-flash
Z.ai (Zhipu)⁨US$ 0,15⁩⁨US$ 0,030⁩⁨US$ 0,50⁩1M—
GPT-6 Luna
gpt-6-luna
OpenAI⁨US$ 0,10⁩*⁨US$ 0,010⁩⁨US$ 0,50⁩1,05M2026-09-22
Qwen3.7-Flash
qwen3.7-flash
Alibaba Cloud (Qwen)⁨US$ 0,028⁩*⁨US$ 0,006⁩⁨US$ 0,11⁩1M2026-07-15

Amerikaanse dollar per miljoen tokens, standaardklasse, tarief voor korte prompts · * lange prompts kosten meer

Bereken de prijs van uw workload

Zo leest u deze prijzen

De prijs voor gecachete input is doorslaggevend

In een agentloop worden de systeemprompt, tooldefinities en eerdere beurten bij elke call opnieuw verstuurd. Providers rekenen een fractie van het normale inputtarief wanneer die prefix uit de cache wordt opgehaald, vaak een tiende of minder. Daardoor kan een model met goedkope cache-input voordeliger zijn dan een model met een lagere standaardprijs.

Lange prompts kunnen de prijs van de hele call verhogen

OpenAI, Google's Pro-preview, xAI en Qwen rekenen een hoger tarief zodra één prompt een drempel zoals 200K of 272K tokens overschrijdt. Dat hogere tarief geldt voor alle tokens in dat verzoek. Anthropic rekent momenteel het standaardtarief voor het volledige contextvenster van een miljoen tokens.

Redeneertokens worden als output gefactureerd

Modellen die nadenken voordat ze antwoorden, rekenen hun verborgen redeneerstappen af tegen het outputtarief. Verlaag de inspanningsinstelling voor routinestappen en gebruik de hoge instellingen alleen voor planning of lastige debugging.

Batch- en daluurkortingen passen zelden bij agents

Batch-endpoints halveren de prijs, maar leveren resultaten pas na enkele uren. Dat is geschikt voor evaluaties en backfills, maar niet voor live agents. Het daltarief van DeepSeek is de uitzondering die kan werken voor geplande taken.

Veelgestelde vragen van bouwers

Welk model is het goedkoopst voor een AI-agent?

Voor onze codeerworkload van 30 stappen zijn de goedkoopste modellen kleine modellen: GPT-6 Luna, Qwen3.7-Flash en GLM-5.3-Flash, elk ongeveer 10 tot 20 cent per taak. Een lage prijs per stap betekent niet automatisch lage kosten per taak als het model meer stappen of retries nodig heeft. Test daarom twee of drie kandidaten met uw eigen traces.

Waarom kost mijn agent veel meer dan de prijs per token doet vermoeden?

Omdat bij elke stap het steeds langere gesprek opnieuw wordt verstuurd. Een taak van 30 stappen met een startprompt van 25K tokens verstuurt in totaal ruim drie miljoen inputtokens. Promptcaching, kortere tooloutputs en het samenvatten van eerdere beurten besparen meer dan overstappen op een ander model.

Zijn dit de definitieve prijzen?

Dit zijn de lijstprijzen in Amerikaanse dollars op de prijspagina van elke provider op 1 October 2026, exclusief belastingen, regionale toeslagen en onderhandelde kortingen. Prijzen die als afkomstig van derden zijn gemarkeerd, konden niet op de eigen pagina van de leverancier worden gecontroleerd.

Wat is het verschil tussen gecachete input en cache writes?

Een cache read is het lagere tarief voor tokens die al in de cache staan. Sommige providers, waaronder Anthropic, rekenen ook een toeslag wanneer een prefix voor het eerst in de cache wordt opgeslagen. De tabel toont de read-prijzen; eventuele write-prijzen staan vermeld op de pagina van het betreffende model.

Onafhankelijke referentie voor iedereen die AI-agents bouwt. Niet verbonden aan een van de genoemde leveranciers.

© 2026 DotsAgent · Feiten gecontroleerd op 1 oktober 2026