Calculadora de custos de agentes
Um agente funciona em loop: a cada chamada, reenvia tudo o que veio antes, mais o resultado mais recente de uma ferramenta. Descreva esse loop uma vez e veja quanto custa uma tarefa — e um mês de tarefas — em cada modelo da nossa tabela de preços.
| Modelo | Por tarefa | 30 dias, 50 por dia |
|---|---|---|
| GPT-6 Luna | US$ 0,099 | US$ 148 |
| Qwen3.7-Flash28 chamadas com tarifa de prompt longo | US$ 0,101 | US$ 152 |
| GLM-5.3-Flash | US$ 0,182 | US$ 273 |
| DeepSeek-V4.1-Flash | US$ 0,218 | US$ 327 |
| Gemini 3.5 Flash-Lite | US$ 0,333 | US$ 499 |
| Qwen3.7-Plus | US$ 0,343 | US$ 515 |
| Mistral Small 4 | US$ 0,526 | US$ 788 |
| Gemini 3.8 Flash | US$ 0,742 | US$ 1.112 |
| DeepSeek-V4-Pro-0813 | US$ 0,961 | US$ 1.441 |
| Claude Haiku 4.5 | US$ 0,989 | US$ 1.483 |
| Amazon Nova 2 Litepreço de terceiros | US$ 1,10 | US$ 1.647 |
| Grok Build 0.1 | US$ 1,16 | US$ 1.746 |
| Muse Spark 1.3 | US$ 1,23 | US$ 1.852 |
| Grok 4.3 | US$ 1,31 | US$ 1.970 |
| Gemini 3.5 Flash | US$ 1,54 | US$ 2.306 |
| Qwen3.8-Max | US$ 1,63 | US$ 2.443 |
| GLM-5.3 | US$ 1,63 | US$ 2.446 |
| GPT-6.1 Sol | US$ 1,69 | US$ 2.541 |
| Claude Sonnet 5.5 | US$ 1,98 | US$ 2.966 |
| Gemini 3.1 Pro Preview | US$ 2,05 | US$ 3.074 |
| Grok 4.7 | US$ 2,68 | US$ 4.026 |
| Kimi K3 | US$ 2,97 | US$ 4.449 |
| Claude Opus 5.5 | US$ 3,39 | US$ 5.082 |
| Amazon Nova 2 Propreço de terceiros | US$ 4,56 | US$ 6.840 |
| Mistral Medium 3.5 | US$ 5,31 | US$ 7.965 |
| Claude Fable 5.1 | US$ 7,76 | US$ 11.642 |
| Command A+excede a janela de contextopreço de terceiros | US$ 8,76 | US$ 13.140 |
| GPT-6 Astra | US$ 9,89 | US$ 14.831 |
Como a estimativa é calculada
Para cada chamada no loop, usamos o tamanho do prompt — o primeiro prompt mais o crescimento acumulado em cada etapa anterior — e o dividimos entre uma parcela em cache e uma parcela nova. A primeira chamada é sempre nova. Os tokens novos são cobrados pela tarifa de entrada, os tokens em cache pela tarifa de cache e a saída pela tarifa de saída.
Se um prompt ultrapassar o limite de contexto longo do provedor, a chamada inteira será cobrada pela tarifa de prompt longo, como fazem OpenAI, Google, xAI e Qwen. Se o maior prompt exceder a janela de contexto do modelo, a linha será sinalizada, pois um agente real teria de reduzir ou resumir o histórico primeiro.
O comportamento de agentes reais varia de uma tarefa para outra: eles repetem etapas que falham e às vezes param antes de concluir. Use estes valores para comparar modelos na mesma carga de trabalho e, antes de definir o orçamento, meça a contagem real de tokens nos seus próprios traces.
Dúvidas sobre custos de agentes
Quantos tokens um agente de IA usa por tarefa?
Isso depende principalmente do número de etapas e do quanto cada uma acrescenta. Uma conversa curta de suporte pode usar 30K tokens de entrada; uma tarefa de programação com 30 etapas e um prompt inicial de 25K tokens envia mais de três milhões, porque o histórico inteiro é reenviado a cada chamada.
Como reduzir o custo de um agente?
Mantenha o início do prompt igual entre as chamadas para aproveitar o cache, limite os resultados das ferramentas ao que o modelo precisa, resuma ou descarte as interações antigas, use um modelo pequeno nas etapas rotineiras e um maior apenas no planejamento, e reduza o esforço de raciocínio quando a qualidade permitir.
O cache de prompts é usado automaticamente?
Com OpenAI, DeepSeek, Kimi e o cache implícito de Gemini, sim, quando os prompts compartilham um prefixo longo. Anthropic e alguns endpoints de Qwen exigem marcadores explícitos de cache, e Anthropic cobra um adicional pela primeira gravação.
Por que o modelo mais barato por token não é o mais barato por tarefa?
Os descontos de cache variam conforme o modelo, alguns provedores cobram uma tarifa maior por prompts longos e modelos de raciocínio gastam tokens de saída pensando. Um modelo que exige menos etapas ou tentativas também pode custar menos no total, algo que esta calculadora não consegue levar em conta.