Modellen en API-prijzen voor agentbouwers
Een agent betaalt voor elke stap die hij zet, en het grootste deel van die kosten komt van input die hij al eerder heeft verstuurd. In deze tabel staan lijstprijzen, cachekortingen en contextlimieten naast elkaar, zodat u een model kunt kiezen op basis van de kosten van een volledige taak, niet van de prijs die op het eerste gezicht opvalt.
Alle modellen in één tabel
| Provider | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | US$ 10* | US$ 1 | US$ 50 | 1,05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | US$ 10 | US$ 0,25 | US$ 50 | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | US$ 4 | US$ 0,20 | US$ 20 | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | US$ 3 | US$ 0,30 | US$ 15 | 1,05M | 2026-07-16 |
| Command A+prijs van derden | Cohere | US$ 2,50 | — | US$ 10 | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | US$ 2* | US$ 0,10 | US$ 10 | 1,05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | US$ 2 | US$ 0,20 | US$ 10 | 1M | 2026-09-28 |
| Gemini 3.1 Pro Previewpreview | US$ 2* | US$ 0,20 | US$ 12 | 1,05M | 2026-02-19 | |
| Grok 4.7 | xAI | US$ 2* | US$ 0,50 | US$ 6 | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | US$ 1,65 | US$ 0,21 | US$ 4,95 | 1M | 2026-08-03 |
| Gemini 3.5 Flash | US$ 1,50 | US$ 0,15 | US$ 9 | 1,05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | US$ 1,50 | — | US$ 7,50 | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | US$ 1,40 | US$ 0,26 | US$ 4,40 | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | US$ 1,32 | US$ 0,044 | US$ 3,96 | 1M | 2026-08-13 |
| Grok 4.3 | xAI | US$ 1,25* | US$ 0,20 | US$ 2,50 | 1M | — |
| Muse Spark 1.3 | Meta | US$ 1,25 | US$ 0,15 | US$ 4,25 | 1M | 2026-09-02 |
| Amazon Nova 2 Propreviewprijs van derden | Amazon | US$ 1,25 | — | US$ 10 | — | — |
| Claude Haiku 4.5 | Anthropic | US$ 1 | US$ 0,10 | US$ 5 | 200K | — |
| Grok Build 0.1 | xAI | US$ 1* | US$ 0,20 | US$ 2 | 256K | — |
| Gemini 3.8 Flash | US$ 0,75 | US$ 0,075 | US$ 3,75 | 1,05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | US$ 0,30 | US$ 0,030 | US$ 2,50 | 1,05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | US$ 0,30 | US$ 0,006 | US$ 1,20 | 1M | 2026-09-10 |
| Amazon Nova 2 Liteprijs van derden | Amazon | US$ 0,30 | — | US$ 2,50 | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | US$ 0,28* | US$ 0,056 | US$ 1,10 | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | US$ 0,15 | — | US$ 0,60 | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | US$ 0,15 | US$ 0,030 | US$ 0,50 | 1M | — |
| GPT-6 Luna | OpenAI | US$ 0,10* | US$ 0,010 | US$ 0,50 | 1,05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | US$ 0,028* | US$ 0,006 | US$ 0,11 | 1M | 2026-07-15 |
Bereken de prijs van uw workload
Zo leest u deze prijzen
De prijs voor gecachete input is doorslaggevend
In een agentloop worden de systeemprompt, tooldefinities en eerdere beurten bij elke call opnieuw verstuurd. Providers rekenen een fractie van het normale inputtarief wanneer die prefix uit de cache wordt opgehaald, vaak een tiende of minder. Daardoor kan een model met goedkope cache-input voordeliger zijn dan een model met een lagere standaardprijs.
Lange prompts kunnen de prijs van de hele call verhogen
OpenAI, Google's Pro-preview, xAI en Qwen rekenen een hoger tarief zodra één prompt een drempel zoals 200K of 272K tokens overschrijdt. Dat hogere tarief geldt voor alle tokens in dat verzoek. Anthropic rekent momenteel het standaardtarief voor het volledige contextvenster van een miljoen tokens.
Redeneertokens worden als output gefactureerd
Modellen die nadenken voordat ze antwoorden, rekenen hun verborgen redeneerstappen af tegen het outputtarief. Verlaag de inspanningsinstelling voor routinestappen en gebruik de hoge instellingen alleen voor planning of lastige debugging.
Batch- en daluurkortingen passen zelden bij agents
Batch-endpoints halveren de prijs, maar leveren resultaten pas na enkele uren. Dat is geschikt voor evaluaties en backfills, maar niet voor live agents. Het daltarief van DeepSeek is de uitzondering die kan werken voor geplande taken.
Veelgestelde vragen van bouwers
Welk model is het goedkoopst voor een AI-agent?
Voor onze codeerworkload van 30 stappen zijn de goedkoopste modellen kleine modellen: GPT-6 Luna, Qwen3.7-Flash en GLM-5.3-Flash, elk ongeveer 10 tot 20 cent per taak. Een lage prijs per stap betekent niet automatisch lage kosten per taak als het model meer stappen of retries nodig heeft. Test daarom twee of drie kandidaten met uw eigen traces.
Waarom kost mijn agent veel meer dan de prijs per token doet vermoeden?
Omdat bij elke stap het steeds langere gesprek opnieuw wordt verstuurd. Een taak van 30 stappen met een startprompt van 25K tokens verstuurt in totaal ruim drie miljoen inputtokens. Promptcaching, kortere tooloutputs en het samenvatten van eerdere beurten besparen meer dan overstappen op een ander model.
Zijn dit de definitieve prijzen?
Dit zijn de lijstprijzen in Amerikaanse dollars op de prijspagina van elke provider op 1 October 2026, exclusief belastingen, regionale toeslagen en onderhandelde kortingen. Prijzen die als afkomstig van derden zijn gemarkeerd, konden niet op de eigen pagina van de leverancier worden gecontroleerd.
Wat is het verschil tussen gecachete input en cache writes?
Een cache read is het lagere tarief voor tokens die al in de cache staan. Sommige providers, waaronder Anthropic, rekenen ook een toeslag wanneer een prefix voor het eerst in de cache wordt opgeslagen. De tabel toont de read-prijzen; eventuele write-prijzen staan vermeld op de pagina van het betreffende model.