智能体成本计算器
智能体由循环驱动:每次调用都会重新发送此前的全部内容,以及最新的工具结果。只需描述一次这个循环,即可查看我们的价格表中每款模型执行单个任务和每月任务的费用。
| 模型 | 每个任务 | 按每天 50 个任务计算 30 天 |
|---|---|---|
| GPT-6 Luna | US$0.099 | US$148 |
| Qwen3.7-Flash28 次调用按长 prompt 费率计费 | US$0.101 | US$152 |
| GLM-5.3-Flash | US$0.182 | US$273 |
| DeepSeek-V4.1-Flash | US$0.218 | US$327 |
| Gemini 3.5 Flash-Lite | US$0.333 | US$499 |
| Qwen3.7-Plus | US$0.343 | US$515 |
| Mistral Small 4 | US$0.526 | US$788 |
| Gemini 3.8 Flash | US$0.742 | US$1,112 |
| DeepSeek-V4-Pro-0813 | US$0.961 | US$1,441 |
| Claude Haiku 4.5 | US$0.989 | US$1,483 |
| Amazon Nova 2 Lite第三方价格 | US$1.10 | US$1,647 |
| Grok Build 0.1 | US$1.16 | US$1,746 |
| Muse Spark 1.3 | US$1.23 | US$1,852 |
| Grok 4.3 | US$1.31 | US$1,970 |
| Gemini 3.5 Flash | US$1.54 | US$2,306 |
| Qwen3.8-Max | US$1.63 | US$2,443 |
| GLM-5.3 | US$1.63 | US$2,446 |
| GPT-6.1 Sol | US$1.69 | US$2,541 |
| Claude Sonnet 5.5 | US$1.98 | US$2,966 |
| Gemini 3.1 Pro Preview | US$2.05 | US$3,074 |
| Grok 4.7 | US$2.68 | US$4,026 |
| Kimi K3 | US$2.97 | US$4,449 |
| Claude Opus 5.5 | US$3.39 | US$5,082 |
| Amazon Nova 2 Pro第三方价格 | US$4.56 | US$6,840 |
| Mistral Medium 3.5 | US$5.31 | US$7,965 |
| Claude Fable 5.1 | US$7.76 | US$11,642 |
| Command A+超过上下文窗口第三方价格 | US$8.76 | US$13,140 |
| GPT-6 Astra | US$9.89 | US$14,831 |
估算方法
对于循环中的每次调用,我们会根据 prompt 大小计算费用:prompt 大小由首个 prompt 加上此前每一步增加的内容组成,并拆分为缓存部分和未缓存部分。首次调用始终按未缓存部分计算。未缓存 token 按输入费率计费,缓存 token 按缓存费率计费,输出 token 则按输出费率计费。
如果单个 prompt 超过服务商的长上下文阈值,整次调用都会按长 prompt 费率计费,OpenAI、Google、xAI 和 Qwen 都采用这种方式。如果最大 prompt 超出模型的上下文窗口,表格会标记该行,因为实际使用时,agent 必须先精简或总结历史记录。
实际 agent 的任务各不相同,也会重试失败的步骤,有时还会提前停止。请将这些数据用于比较同一工作负载下的不同模型;制定预算前,请先根据自己的运行记录测量实际 token 用量。
关于 agent 成本的常见问题
AI agent 每个任务会使用多少 token?
这主要取决于步骤数以及每一步新增的内容。简短的客服对话可能使用 30K 个输入 token;如果是从 25K-token 初始 prompt 开始的 30 步编程任务,输入量会超过三百万个 token,因为每次调用都会重新发送完整历史记录。
如何降低 agent 的成本?
确保各次调用的 prompt 开头保持一致,以便命中缓存;将工具结果精简到模型所需的内容;总结或删除较早的对话轮次;日常步骤使用小模型,仅在规划时使用大模型;在质量允许的情况下,降低推理强度。
prompt 缓存会自动生效吗?
对于 OpenAI、DeepSeek、Kimi 和 Gemini 的隐式缓存,只要 prompt 共用较长的前缀,缓存就会自动生效。Anthropic 和部分 Qwen endpoint 需要显式添加缓存标记;Anthropic 首次写入缓存还会收取额外费用。
为什么每个 token 价格最低的模型,每个任务的成本却不一定最低?
不同模型的缓存折扣各不相同,有些服务商会对长 prompt 按更高费率计费,而推理模型会消耗输出 token 进行思考。如果某个模型所需步骤更少或重试更少,成本也可能更低;此计算器无法体现这些因素。