エージェントのコスト計算
エージェントはループで動作します。呼び出しのたびに、それまでの全内容と最新のツール結果が再送信されます。このループを一度設定するだけで、料金表に掲載された各モデルで、タスク1件と月間のタスク実行にかかるコストを確認できます。
| モデル | タスクあたり | 1日50回、30日間 |
|---|---|---|
| GPT-6 Luna | $0.099 | $148 |
| Qwen3.7-Flash長文プロンプト料金が適用される呼び出し28回 | $0.101 | $152 |
| GLM-5.3-Flash | $0.182 | $273 |
| DeepSeek-V4.1-Flash | $0.218 | $327 |
| Gemini 3.5 Flash-Lite | $0.333 | $499 |
| Qwen3.7-Plus | $0.343 | $515 |
| Mistral Small 4 | $0.526 | $788 |
| Gemini 3.8 Flash | $0.742 | $1,112 |
| DeepSeek-V4-Pro-0813 | $0.961 | $1,441 |
| Claude Haiku 4.5 | $0.989 | $1,483 |
| Amazon Nova 2 Liteサードパーティ価格 | $1.10 | $1,647 |
| Grok Build 0.1 | $1.16 | $1,746 |
| Muse Spark 1.3 | $1.23 | $1,852 |
| Grok 4.3 | $1.31 | $1,970 |
| Gemini 3.5 Flash | $1.54 | $2,306 |
| Qwen3.8-Max | $1.63 | $2,443 |
| GLM-5.3 | $1.63 | $2,446 |
| GPT-6.1 Sol | $1.69 | $2,541 |
| Claude Sonnet 5.5 | $1.98 | $2,966 |
| Gemini 3.1 Pro Preview | $2.05 | $3,074 |
| Grok 4.7 | $2.68 | $4,026 |
| Kimi K3 | $2.97 | $4,449 |
| Claude Opus 5.5 | $3.39 | $5,082 |
| Amazon Nova 2 Proサードパーティ価格 | $4.56 | $6,840 |
| Mistral Medium 3.5 | $5.31 | $7,965 |
| Claude Fable 5.1 | $7.76 | $11,642 |
| Command A+コンテキストウィンドウを超過サードパーティ価格 | $8.76 | $13,140 |
| GPT-6 Astra | $9.89 | $14,831 |
推定方法
ループ内の各呼び出しについて、プロンプトのサイズを、最初のプロンプトと、それ以前の各ステップで増えた分の合計として算出し、キャッシュ利用分と新規分に分けます。最初の呼び出しは常に新規分です。新規トークンには入力料金、キャッシュされたトークンにはキャッシュ料金、出力には出力料金が適用されます。
1つのプロンプトがプロバイダーの長文コンテキストのしきい値を超えると、OpenAI、Google、xAI、Qwenと同様に、その呼び出し全体に長文プロンプト料金が適用されます。最大のプロンプトがモデルのコンテキストウィンドウを超える場合は、その行に印が付きます。実際のエージェントでは、先に履歴を削るか要約する必要があります。
実際のエージェントでは、タスクごとに処理内容が異なり、失敗したステップを再試行したり、途中で処理を終了したりすることもあります。ここに示す数値は、同じワークロードでモデルを比較するための目安としてご利用ください。予算を立てる前に、ご自身のトレースから実際のトークン数を計測してください。
エージェントのコストに関するよくある質問
AIエージェントは1つのタスクで何トークン使いますか?
主にステップ数と、各ステップで追加される情報量によって異なります。短いサポート対応では入力トークンが30K程度の場合があります。一方、開始時のプロンプトが25Kトークンで30ステップのコーディングタスクを行うと、呼び出しのたびに履歴全体を再送信するため、送信するトークン数は300万を超えます。
エージェントのコストを下げるにはどうすればよいですか?
呼び出し間でプロンプトの冒頭部分を同一に保ち、キャッシュが使われるようにします。ツールの結果はモデルに必要な情報だけに絞り、古いターンは要約するか削除します。定型的なステップには小型モデルを使い、計画には大型モデルを使います。また、品質に影響しない範囲で推論の強度を下げます。
プロンプトのキャッシュは自動で行われますか?
OpenAI、DeepSeek、Kimi、およびGeminiの暗黙的キャッシュでは、プロンプトの長い接頭部分が一致すると、自動的にキャッシュされます。Anthropicや一部のQwenエンドポイントでは明示的なキャッシュマーカーが必要です。また、Anthropicでは最初の書き込みに追加料金がかかります。
トークン単価が最も安いモデルが、タスクあたりでは最安にならないのはなぜですか?
キャッシュ割引はモデルによって異なり、長いプロンプトに高い料金を設定しているプロバイダーもあります。また、推論モデルは思考に出力トークンを使います。ステップ数や再試行回数が少なくて済むモデルのほうが、最終的に安くなることもありますが、この計算ツールでは考慮できません。