Modelle und API-Preise für Agentenentwickler
Ein Agent verursacht bei jedem Schritt Kosten, und den größten Teil davon macht Input aus, den er bereits gesendet hat. Diese Tabelle stellt Listenpreise, Cache-Rabatte und Kontextlimits gegenüber. So wählen Sie ein Modell danach aus, was eine vollständige Aufgabe kostet – nicht nach dem auffälligen Listenpreis.
Alle Modelle in einer Tabelle
| Anbieter | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 10 $* | 1 $ | 50 $ | 1,05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | 10 $ | 0,25 $ | 50 $ | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | 4 $ | 0,20 $ | 20 $ | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | 3 $ | 0,30 $ | 15 $ | 1,05M | 2026-07-16 |
| Command A+Preis eines Drittanbieters | Cohere | 2,50 $ | — | 10 $ | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | 2 $* | 0,10 $ | 10 $ | 1,05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | 2 $ | 0,20 $ | 10 $ | 1M | 2026-09-28 |
| Gemini 3.1 Pro PreviewVorschau | 2 $* | 0,20 $ | 12 $ | 1,05M | 2026-02-19 | |
| Grok 4.7 | xAI | 2 $* | 0,50 $ | 6 $ | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | 1,65 $ | 0,21 $ | 4,95 $ | 1M | 2026-08-03 |
| Gemini 3.5 Flash | 1,50 $ | 0,15 $ | 9 $ | 1,05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | 1,50 $ | — | 7,50 $ | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | 1,40 $ | 0,26 $ | 4,40 $ | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | 1,32 $ | 0,044 $ | 3,96 $ | 1M | 2026-08-13 |
| Grok 4.3 | xAI | 1,25 $* | 0,20 $ | 2,50 $ | 1M | — |
| Muse Spark 1.3 | Meta | 1,25 $ | 0,15 $ | 4,25 $ | 1M | 2026-09-02 |
| Amazon Nova 2 ProVorschauPreis eines Drittanbieters | Amazon | 1,25 $ | — | 10 $ | — | — |
| Claude Haiku 4.5 | Anthropic | 1 $ | 0,10 $ | 5 $ | 200K | — |
| Grok Build 0.1 | xAI | 1 $* | 0,20 $ | 2 $ | 256K | — |
| Gemini 3.8 Flash | 0,75 $ | 0,075 $ | 3,75 $ | 1,05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | 0,30 $ | 0,030 $ | 2,50 $ | 1,05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | 0,30 $ | 0,006 $ | 1,20 $ | 1M | 2026-09-10 |
| Amazon Nova 2 LitePreis eines Drittanbieters | Amazon | 0,30 $ | — | 2,50 $ | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | 0,28 $* | 0,056 $ | 1,10 $ | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | 0,15 $ | — | 0,60 $ | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | 0,15 $ | 0,030 $ | 0,50 $ | 1M | — |
| GPT-6 Luna | OpenAI | 0,10 $* | 0,010 $ | 0,50 $ | 1,05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | 0,028 $* | 0,006 $ | 0,11 $ | 1M | 2026-07-15 |
So lesen Sie die Preise
Der Preis für gecachten Input ist entscheidend
In einer Agentenschleife werden der System-Prompt, die Tool-Definitionen und frühere Gesprächsrunden bei jedem Aufruf erneut gesendet. Anbieter berechnen nur einen Bruchteil des normalen Input-Preises, wenn dieser Präfix aus dem Cache bereitgestellt wird – oft ein Zehntel oder weniger. Deshalb kann ein Modell mit günstigem Cache ein Modell mit niedrigerem Listenpreis übertreffen.
Lange Prompts können den Preis des gesamten Aufrufs erhöhen
OpenAI, Googles Pro Preview, xAI und Qwen verlangen einen höheren Preis, sobald ein einzelner Prompt einen Schwellenwert wie 200K oder 272K Tokens überschreitet. Der höhere Preis gilt dann für alle Tokens dieser Anfrage. Anthropic berechnet derzeit für sein gesamtes Kontextfenster mit einer Million Tokens den Standardpreis.
Reasoning-Tokens werden als Output berechnet
Modelle, die vor der Antwort nachdenken, berechnen ihre verborgenen Reasoning-Tokens zum Output-Preis. Wählen Sie für Routineaufgaben eine niedrigere Effort-Einstellung und nutzen Sie hohe Einstellungen für Planung oder schwieriges Debugging.
Batch- und Nebenzeitenrabatte passen selten zu Agenten
Batch-Endpoints halbieren den Preis, liefern Ergebnisse aber erst innerhalb mehrerer Stunden. Das eignet sich für Evaluierungen und Backfills, nicht für Live-Agenten. Der Nebenzeitenpreis von DeepSeek ist eine Ausnahme, die sich für geplante Jobs eignen kann.
Häufige Fragen von Entwicklern
Welches Modell ist für einen KI-Agenten am günstigsten?
Bei unserem Coding-Workload mit 30 Schritten sind kleine Modelle am günstigsten: GPT-6 Luna, Qwen3.7-Flash und GLM-5.3-Flash kosten jeweils etwa 10 bis 20 Cent pro Aufgabe. Ein niedriger Preis pro Schritt bedeutet nicht automatisch niedrige Kosten pro Aufgabe, wenn das Modell mehr Schritte oder Wiederholungen benötigt. Testen Sie daher zwei oder drei Kandidaten mit Ihren eigenen Traces.
Warum kostet mein Agent viel mehr, als der Preis pro Token vermuten lässt?
Weil bei jedem Schritt die wachsende Unterhaltung erneut gesendet wird. Bei einer Aufgabe mit 30 Schritten und einem Start-Prompt mit 25K Tokens werden insgesamt weit über drei Millionen Input-Tokens gesendet. Prompt-Caching, kürzere Tool-Ausgaben und Zusammenfassungen älterer Gesprächsrunden senken diese Zahl stärker als ein Modellwechsel.
Sind das die endgültigen Preise?
Es handelt sich um Listenpreise in US-Dollar von den Preisseiten der jeweiligen Anbieter, Stand 1 October 2026, ohne Steuern, regionale Aufschläge oder individuell ausgehandelte Rabatte. Als Drittanbieterpreis gekennzeichnete Preise ließen sich nicht auf der Website des Anbieters selbst finden.
Was ist der Unterschied zwischen gecachtem Input und Cache-Schreibvorgängen?
Ein Cache-Lesezugriff ist der ermäßigte Preis für Tokens, die sich bereits im Cache befinden. Einige Anbieter, darunter Anthropic, berechnen außerdem einen Aufpreis, wenn ein Präfix zum ersten Mal in den Cache geschrieben wird. Die Tabelle zeigt die Preise für Lesezugriffe; geltende Schreibpreise sind auf der jeweiligen Modellseite vermerkt.