Agentenkostenrechner
Ein Agent arbeitet in einer Schleife: Bei jedem Aufruf werden alle bisherigen Inhalte sowie das neueste Tool-Ergebnis erneut gesendet. Beschreiben Sie diese Schleife einmal und sehen Sie, was eine Aufgabe und ein Monat voller Aufgaben mit jedem Modell in unserer Preistabelle kosten.
| Modell | Pro Aufgabe | 30 Tage mit 50 pro Tag |
|---|---|---|
| GPT-6 Luna | 0,099 $ | 148 $ |
| Qwen3.7-Flash28 Aufrufe zum Lang-Prompt-Tarif | 0,101 $ | 152 $ |
| GLM-5.3-Flash | 0,182 $ | 273 $ |
| DeepSeek-V4.1-Flash | 0,218 $ | 327 $ |
| Gemini 3.5 Flash-Lite | 0,333 $ | 499 $ |
| Qwen3.7-Plus | 0,343 $ | 515 $ |
| Mistral Small 4 | 0,526 $ | 788 $ |
| Gemini 3.8 Flash | 0,742 $ | 1.112 $ |
| DeepSeek-V4-Pro-0813 | 0,961 $ | 1.441 $ |
| Claude Haiku 4.5 | 0,989 $ | 1.483 $ |
| Amazon Nova 2 LitePreis eines Drittanbieters | 1,10 $ | 1.647 $ |
| Grok Build 0.1 | 1,16 $ | 1.746 $ |
| Muse Spark 1.3 | 1,23 $ | 1.852 $ |
| Grok 4.3 | 1,31 $ | 1.970 $ |
| Gemini 3.5 Flash | 1,54 $ | 2.306 $ |
| Qwen3.8-Max | 1,63 $ | 2.443 $ |
| GLM-5.3 | 1,63 $ | 2.446 $ |
| GPT-6.1 Sol | 1,69 $ | 2.541 $ |
| Claude Sonnet 5.5 | 1,98 $ | 2.966 $ |
| Gemini 3.1 Pro Preview | 2,05 $ | 3.074 $ |
| Grok 4.7 | 2,68 $ | 4.026 $ |
| Kimi K3 | 2,97 $ | 4.449 $ |
| Claude Opus 5.5 | 3,39 $ | 5.082 $ |
| Amazon Nova 2 ProPreis eines Drittanbieters | 4,56 $ | 6.840 $ |
| Mistral Medium 3.5 | 5,31 $ | 7.965 $ |
| Claude Fable 5.1 | 7,76 $ | 11.642 $ |
| Command A+überschreitet das KontextfensterPreis eines Drittanbieters | 8,76 $ | 13.140 $ |
| GPT-6 Astra | 9,89 $ | 14.831 $ |
So funktioniert die Schätzung
Für jeden Aufruf in der Schleife ermitteln wir die Prompt-Größe – den ersten Prompt zuzüglich des Zuwachses aus jedem vorherigen Schritt – und teilen sie in einen gecachten und einen neuen Anteil auf. Der erste Aufruf ist immer vollständig neu. Neue Tokens werden zum Input-Tarif, gecachte Tokens zum Cache-Tarif und Output-Tokens zum Output-Tarif abgerechnet.
Überschreitet ein einzelner Prompt den Langkontext-Schwellenwert eines Anbieters, wird der gesamte Aufruf zum Lang-Prompt-Tarif abgerechnet, wie es OpenAI, Google, xAI und Qwen handhaben. Ist der längste Prompt größer als das Kontextfenster des Modells, wird die Zeile entsprechend markiert, da ein echter Agent seinen Verlauf zuerst kürzen oder zusammenfassen müsste.
Der tatsächliche Ablauf variiert von Aufgabe zu Aufgabe: Agents wiederholen fehlgeschlagene Schritte und brechen manchmal vorzeitig ab. Nutze diese Zahlen, um Modelle für dieselbe Arbeitslast zu vergleichen, und miss die tatsächlichen Token-Anzahlen anhand deiner eigenen Traces, bevor du ein Budget festlegst.
Fragen zu Agent-Kosten
Wie viele Tokens verbraucht ein AI-Agent pro Aufgabe?
Das hängt vor allem von der Anzahl der Schritte und davon ab, wie viel jeder Schritt hinzufügt. Ein kurzer Support-Austausch kann 30K Input-Tokens verbrauchen. Bei einer 30 Schritte langen Coding-Aufgabe mit einem Start-Prompt von 25K Tokens werden über drei Millionen Tokens gesendet, weil bei jedem Aufruf der gesamte Verlauf erneut übertragen wird.
Wie kann ich die Kosten eines Agents senken?
Lass den Anfang des Prompts bei allen Aufrufen unverändert, damit er gecacht werden kann. Kürze Tool-Ergebnisse auf das, was das Modell braucht, fasse ältere Turns zusammen oder entferne sie, nutze für Routineaufgaben ein kleines Modell und nur für die Planung ein großes, und reduziere den Reasoning-Aufwand, sofern die Qualität darunter nicht leidet.
Funktioniert Prompt-Caching automatisch?
Bei OpenAI, DeepSeek, Kimi und dem impliziten Caching von Gemini funktioniert es automatisch, wenn Prompts ein langes Präfix gemeinsam haben. Anthropic und einige Qwen-Endpunkte benötigen explizite Cache-Marker; Anthropic berechnet für den ersten Schreibvorgang zusätzliche Kosten.
Warum ist das günstigste Modell pro Token nicht auch das günstigste pro Aufgabe?
Cache-Rabatte unterscheiden sich je nach Modell, manche Anbieter berechnen für lange Prompts einen höheren Tarif, und Reasoning-Modelle verbrauchen Output-Tokens beim Nachdenken. Auch ein Modell, das weniger Schritte oder Wiederholungen benötigt, kann günstiger sein – das kann dieser Rechner jedoch nicht berücksichtigen.