dotsagent.io
Idioma:Português
Desenvolvimento · ferramenta

Calculadora de custos de agentes

Um agente funciona em loop: a cada chamada, reenvia tudo o que veio antes, mais o resultado mais recente de uma ferramenta. Descreva esse loop uma vez e veja quanto custa uma tarefa — e um mês de tarefas — em cada modelo da nossa tabela de preços.

Começar com uma carga de trabalho

Lê arquivos, edita código e executa testes em um repositório. Usa um prompt de sistema grande com schemas de ferramentas, e cada etapa adiciona um arquivo ou log de teste.

Cada tarefa envia 3.360.000 tokens de entrada e recebe 36.000 tokens de saída. O maior prompt tem 199.000 tokens.

Custo estimado por tarefa e por mês em cada modelo
ModeloPor tarefa30 dias, 50 por dia
GPT-6 Luna · OpenAI⁨US$ 0,099⁩⁨US$ 148⁩
Qwen3.7-Flash · Alibaba Cloud (Qwen)28 chamadas com tarifa de prompt longo⁨US$ 0,101⁩⁨US$ 152⁩
GLM-5.3-Flash · Z.ai (Zhipu)⁨US$ 0,182⁩⁨US$ 273⁩
DeepSeek-V4.1-Flash · DeepSeek⁨US$ 0,218⁩⁨US$ 327⁩
Gemini 3.5 Flash-Lite · Google⁨US$ 0,333⁩⁨US$ 499⁩
Qwen3.7-Plus · Alibaba Cloud (Qwen)⁨US$ 0,343⁩⁨US$ 515⁩
Mistral Small 4 · Mistral AI⁨US$ 0,526⁩⁨US$ 788⁩
Gemini 3.8 Flash · Google⁨US$ 0,742⁩⁨US$ 1.112⁩
DeepSeek-V4-Pro-0813 · DeepSeek⁨US$ 0,961⁩⁨US$ 1.441⁩
Claude Haiku 4.5 · Anthropic⁨US$ 0,989⁩⁨US$ 1.483⁩
Amazon Nova 2 Lite · Amazonpreço de terceiros⁨US$ 1,10⁩⁨US$ 1.647⁩
Grok Build 0.1 · xAI⁨US$ 1,16⁩⁨US$ 1.746⁩
Muse Spark 1.3 · Meta⁨US$ 1,23⁩⁨US$ 1.852⁩
Grok 4.3 · xAI⁨US$ 1,31⁩⁨US$ 1.970⁩
Gemini 3.5 Flash · Google⁨US$ 1,54⁩⁨US$ 2.306⁩
Qwen3.8-Max · Alibaba Cloud (Qwen)⁨US$ 1,63⁩⁨US$ 2.443⁩
GLM-5.3 · Z.ai (Zhipu)⁨US$ 1,63⁩⁨US$ 2.446⁩
GPT-6.1 Sol · OpenAI⁨US$ 1,69⁩⁨US$ 2.541⁩
Claude Sonnet 5.5 · Anthropic⁨US$ 1,98⁩⁨US$ 2.966⁩
Gemini 3.1 Pro Preview · Google⁨US$ 2,05⁩⁨US$ 3.074⁩
Grok 4.7 · xAI⁨US$ 2,68⁩⁨US$ 4.026⁩
Kimi K3 · Moonshot AI (Kimi)⁨US$ 2,97⁩⁨US$ 4.449⁩
Claude Opus 5.5 · Anthropic⁨US$ 3,39⁩⁨US$ 5.082⁩
Amazon Nova 2 Pro · Amazonpreço de terceiros⁨US$ 4,56⁩⁨US$ 6.840⁩
Mistral Medium 3.5 · Mistral AI⁨US$ 5,31⁩⁨US$ 7.965⁩
Claude Fable 5.1 · Anthropic⁨US$ 7,76⁩⁨US$ 11.642⁩
Command A+ · Cohereexcede a janela de contextopreço de terceiros⁨US$ 8,76⁩⁨US$ 13.140⁩
GPT-6 Astra · OpenAI⁨US$ 9,89⁩⁨US$ 14.831⁩

Preços de tabela, plano padrão, em dólares americanos. Não inclui gravações no cache, impostos, tarifas de ferramentas como busca na web nem sobretaxas regionais.

Como a estimativa é calculada

Para cada chamada no loop, usamos o tamanho do prompt — o primeiro prompt mais o crescimento acumulado em cada etapa anterior — e o dividimos entre uma parcela em cache e uma parcela nova. A primeira chamada é sempre nova. Os tokens novos são cobrados pela tarifa de entrada, os tokens em cache pela tarifa de cache e a saída pela tarifa de saída.

Se um prompt ultrapassar o limite de contexto longo do provedor, a chamada inteira será cobrada pela tarifa de prompt longo, como fazem OpenAI, Google, xAI e Qwen. Se o maior prompt exceder a janela de contexto do modelo, a linha será sinalizada, pois um agente real teria de reduzir ou resumir o histórico primeiro.

O comportamento de agentes reais varia de uma tarefa para outra: eles repetem etapas que falham e às vezes param antes de concluir. Use estes valores para comparar modelos na mesma carga de trabalho e, antes de definir o orçamento, meça a contagem real de tokens nos seus próprios traces.

Dúvidas sobre custos de agentes

Quantos tokens um agente de IA usa por tarefa?

Isso depende principalmente do número de etapas e do quanto cada uma acrescenta. Uma conversa curta de suporte pode usar 30K tokens de entrada; uma tarefa de programação com 30 etapas e um prompt inicial de 25K tokens envia mais de três milhões, porque o histórico inteiro é reenviado a cada chamada.

Como reduzir o custo de um agente?

Mantenha o início do prompt igual entre as chamadas para aproveitar o cache, limite os resultados das ferramentas ao que o modelo precisa, resuma ou descarte as interações antigas, use um modelo pequeno nas etapas rotineiras e um maior apenas no planejamento, e reduza o esforço de raciocínio quando a qualidade permitir.

O cache de prompts é usado automaticamente?

Com OpenAI, DeepSeek, Kimi e o cache implícito de Gemini, sim, quando os prompts compartilham um prefixo longo. Anthropic e alguns endpoints de Qwen exigem marcadores explícitos de cache, e Anthropic cobra um adicional pela primeira gravação.

Por que o modelo mais barato por token não é o mais barato por tarefa?

Os descontos de cache variam conforme o modelo, alguns provedores cobram uma tarifa maior por prompts longos e modelos de raciocínio gastam tokens de saída pensando. Um modelo que exige menos etapas ou tentativas também pode custar menos no total, algo que esta calculadora não consegue levar em conta.

Referência independente para quem cria agentes de IA. Não temos vínculo com nenhum dos fornecedores mencionados aqui.

© 2026 DotsAgent · Fatos verificados em 1 de outubro de 2026