dotsagent.io
Sprache:Deutsch
Build · Preise geprüft am 1 October 2026

Modelle und API-Preise für Agentenentwickler

Ein Agent verursacht bei jedem Schritt Kosten, und den größten Teil davon macht Input aus, den er bereits gesendet hat. Diese Tabelle stellt Listenpreise, Cache-Rabatte und Kontextlimits gegenüber. So wählen Sie ein Modell danach aus, was eine vollständige Aufgabe kostet – nicht nach dem auffälligen Listenpreis.

Alle Modelle in einer Tabelle

API-Listenpreise von Modellen für die Entwicklung von Agents
Anbieter
GPT-6 Astra
gpt-6-astra
OpenAI⁨10 $⁩*⁨1 $⁩⁨50 $⁩1,05M2026-09-08
Claude Fable 5.1
claude-fable-5-1
Anthropic⁨10 $⁩⁨0,25 $⁩⁨50 $⁩1M2026-09-01
Claude Opus 5.5
claude-opus-5-5
Anthropic⁨4 $⁩⁨0,20 $⁩⁨20 $⁩1M2026-09-22
Kimi K3
kimi-k3
Moonshot AI (Kimi)⁨3 $⁩⁨0,30 $⁩⁨15 $⁩1,05M2026-07-16
Command A+Preis eines Drittanbieters
command-a-plus-05-2026
Cohere⁨2,50 $⁩—⁨10 $⁩128K2026-05-20
GPT-6.1 Sol
gpt-6.1-sol
OpenAI⁨2 $⁩*⁨0,10 $⁩⁨10 $⁩1,05M2026-09-29
Claude Sonnet 5.5
claude-sonnet-5-5
Anthropic⁨2 $⁩⁨0,20 $⁩⁨10 $⁩1M2026-09-28
Gemini 3.1 Pro PreviewVorschau
gemini-3.1-pro-preview
Google⁨2 $⁩*⁨0,20 $⁩⁨12 $⁩1,05M2026-02-19
Grok 4.7
grok-4.7
xAI⁨2 $⁩*⁨0,50 $⁩⁨6 $⁩500K2026-09-21
Qwen3.8-Max
qwen3.8-max
Alibaba Cloud (Qwen)⁨1,65 $⁩⁨0,21 $⁩⁨4,95 $⁩1M2026-08-03
Gemini 3.5 Flash
gemini-3.5-flash
Google⁨1,50 $⁩⁨0,15 $⁩⁨9 $⁩1,05M2026-05-19
Mistral Medium 3.5
mistral-medium-3-5
Mistral AI⁨1,50 $⁩—⁨7,50 $⁩256K2026-04-28
GLM-5.3
glm-5.3
Z.ai (Zhipu)⁨1,40 $⁩⁨0,26 $⁩⁨4,40 $⁩1M2026-08-14
DeepSeek-V4-Pro-0813
deepseek-v4-pro
DeepSeek⁨1,32 $⁩⁨0,044 $⁩⁨3,96 $⁩1M2026-08-13
Grok 4.3
grok-4.3
xAI⁨1,25 $⁩*⁨0,20 $⁩⁨2,50 $⁩1M—
Muse Spark 1.3
muse-spark-1.3
Meta⁨1,25 $⁩⁨0,15 $⁩⁨4,25 $⁩1M2026-09-02
Amazon Nova 2 ProVorschauPreis eines DrittanbietersAmazon⁨1,25 $⁩—⁨10 $⁩——
Claude Haiku 4.5
claude-haiku-4-5-20251001
Anthropic⁨1 $⁩⁨0,10 $⁩⁨5 $⁩200K—
Grok Build 0.1
grok-build-0.1
xAI⁨1 $⁩*⁨0,20 $⁩⁨2 $⁩256K—
Gemini 3.8 Flash
gemini-3.8-flash
Google⁨0,75 $⁩⁨0,075 $⁩⁨3,75 $⁩1,05M2026-09-02
Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite
Google⁨0,30 $⁩⁨0,030 $⁩⁨2,50 $⁩1,05M2026-07-21
DeepSeek-V4.1-Flash
deepseek-flash
DeepSeek⁨0,30 $⁩⁨0,006 $⁩⁨1,20 $⁩1M2026-09-10
Amazon Nova 2 LitePreis eines DrittanbietersAmazon⁨0,30 $⁩—⁨2,50 $⁩1M2025-12-02
Qwen3.7-Plus
qwen3.7-plus
Alibaba Cloud (Qwen)⁨0,28 $⁩*⁨0,056 $⁩⁨1,10 $⁩1M2026-05-26
Mistral Small 4
mistral-small-2603
Mistral AI⁨0,15 $⁩—⁨0,60 $⁩256K2026-03-16
GLM-5.3-Flash
glm-5.3-flash
Z.ai (Zhipu)⁨0,15 $⁩⁨0,030 $⁩⁨0,50 $⁩1M—
GPT-6 Luna
gpt-6-luna
OpenAI⁨0,10 $⁩*⁨0,010 $⁩⁨0,50 $⁩1,05M2026-09-22
Qwen3.7-Flash
qwen3.7-flash
Alibaba Cloud (Qwen)⁨0,028 $⁩*⁨0,006 $⁩⁨0,11 $⁩1M2026-07-15

US-Dollar pro Million Token, Standardklasse, Preis für kurze Prompts · * Lange Prompts kosten mehr

Eigenen Workload kalkulieren

So lesen Sie die Preise

Der Preis für gecachten Input ist entscheidend

In einer Agentenschleife werden der System-Prompt, die Tool-Definitionen und frühere Gesprächsrunden bei jedem Aufruf erneut gesendet. Anbieter berechnen nur einen Bruchteil des normalen Input-Preises, wenn dieser Präfix aus dem Cache bereitgestellt wird – oft ein Zehntel oder weniger. Deshalb kann ein Modell mit günstigem Cache ein Modell mit niedrigerem Listenpreis übertreffen.

Lange Prompts können den Preis des gesamten Aufrufs erhöhen

OpenAI, Googles Pro Preview, xAI und Qwen verlangen einen höheren Preis, sobald ein einzelner Prompt einen Schwellenwert wie 200K oder 272K Tokens überschreitet. Der höhere Preis gilt dann für alle Tokens dieser Anfrage. Anthropic berechnet derzeit für sein gesamtes Kontextfenster mit einer Million Tokens den Standardpreis.

Reasoning-Tokens werden als Output berechnet

Modelle, die vor der Antwort nachdenken, berechnen ihre verborgenen Reasoning-Tokens zum Output-Preis. Wählen Sie für Routineaufgaben eine niedrigere Effort-Einstellung und nutzen Sie hohe Einstellungen für Planung oder schwieriges Debugging.

Batch- und Nebenzeitenrabatte passen selten zu Agenten

Batch-Endpoints halbieren den Preis, liefern Ergebnisse aber erst innerhalb mehrerer Stunden. Das eignet sich für Evaluierungen und Backfills, nicht für Live-Agenten. Der Nebenzeitenpreis von DeepSeek ist eine Ausnahme, die sich für geplante Jobs eignen kann.

Häufige Fragen von Entwicklern

Welches Modell ist für einen KI-Agenten am günstigsten?

Bei unserem Coding-Workload mit 30 Schritten sind kleine Modelle am günstigsten: GPT-6 Luna, Qwen3.7-Flash und GLM-5.3-Flash kosten jeweils etwa 10 bis 20 Cent pro Aufgabe. Ein niedriger Preis pro Schritt bedeutet nicht automatisch niedrige Kosten pro Aufgabe, wenn das Modell mehr Schritte oder Wiederholungen benötigt. Testen Sie daher zwei oder drei Kandidaten mit Ihren eigenen Traces.

Warum kostet mein Agent viel mehr, als der Preis pro Token vermuten lässt?

Weil bei jedem Schritt die wachsende Unterhaltung erneut gesendet wird. Bei einer Aufgabe mit 30 Schritten und einem Start-Prompt mit 25K Tokens werden insgesamt weit über drei Millionen Input-Tokens gesendet. Prompt-Caching, kürzere Tool-Ausgaben und Zusammenfassungen älterer Gesprächsrunden senken diese Zahl stärker als ein Modellwechsel.

Sind das die endgültigen Preise?

Es handelt sich um Listenpreise in US-Dollar von den Preisseiten der jeweiligen Anbieter, Stand 1 October 2026, ohne Steuern, regionale Aufschläge oder individuell ausgehandelte Rabatte. Als Drittanbieterpreis gekennzeichnete Preise ließen sich nicht auf der Website des Anbieters selbst finden.

Was ist der Unterschied zwischen gecachtem Input und Cache-Schreibvorgängen?

Ein Cache-Lesezugriff ist der ermäßigte Preis für Tokens, die sich bereits im Cache befinden. Einige Anbieter, darunter Anthropic, berechnen außerdem einen Aufpreis, wenn ein Präfix zum ersten Mal in den Cache geschrieben wird. Die Tabelle zeigt die Preise für Lesezugriffe; geltende Schreibpreise sind auf der jeweiligen Modellseite vermerkt.