dotsagent.io
Idioma:Português
Desenvolvimento · preços verificados em 1 October 2026

Modelos e preços de API para criar agentes

Um agente paga por cada etapa que executa, e a maior parte do custo vem de dados de entrada que ele já enviou. Esta tabela compara preços de tabela, descontos de cache e limites de contexto para que você escolha um modelo pelo custo da tarefa inteira, não pelo preço anunciado.

Todos os modelos em uma tabela

Preços públicos de API dos modelos usados para criar agentes
Provedor
GPT-6 Astra
gpt-6-astra
OpenAI⁨US$ 10⁩*⁨US$ 1⁩⁨US$ 50⁩1,05M2026-09-08
Claude Fable 5.1
claude-fable-5-1
Anthropic⁨US$ 10⁩⁨US$ 0,25⁩⁨US$ 50⁩1M2026-09-01
Claude Opus 5.5
claude-opus-5-5
Anthropic⁨US$ 4⁩⁨US$ 0,20⁩⁨US$ 20⁩1M2026-09-22
Kimi K3
kimi-k3
Moonshot AI (Kimi)⁨US$ 3⁩⁨US$ 0,30⁩⁨US$ 15⁩1,05M2026-07-16
Command A+preço de terceiros
command-a-plus-05-2026
Cohere⁨US$ 2,50⁩—⁨US$ 10⁩128K2026-05-20
GPT-6.1 Sol
gpt-6.1-sol
OpenAI⁨US$ 2⁩*⁨US$ 0,10⁩⁨US$ 10⁩1,05M2026-09-29
Claude Sonnet 5.5
claude-sonnet-5-5
Anthropic⁨US$ 2⁩⁨US$ 0,20⁩⁨US$ 10⁩1M2026-09-28
Gemini 3.1 Pro Previewprévia
gemini-3.1-pro-preview
Google⁨US$ 2⁩*⁨US$ 0,20⁩⁨US$ 12⁩1,05M2026-02-19
Grok 4.7
grok-4.7
xAI⁨US$ 2⁩*⁨US$ 0,50⁩⁨US$ 6⁩500K2026-09-21
Qwen3.8-Max
qwen3.8-max
Alibaba Cloud (Qwen)⁨US$ 1,65⁩⁨US$ 0,21⁩⁨US$ 4,95⁩1M2026-08-03
Gemini 3.5 Flash
gemini-3.5-flash
Google⁨US$ 1,50⁩⁨US$ 0,15⁩⁨US$ 9⁩1,05M2026-05-19
Mistral Medium 3.5
mistral-medium-3-5
Mistral AI⁨US$ 1,50⁩—⁨US$ 7,50⁩256K2026-04-28
GLM-5.3
glm-5.3
Z.ai (Zhipu)⁨US$ 1,40⁩⁨US$ 0,26⁩⁨US$ 4,40⁩1M2026-08-14
DeepSeek-V4-Pro-0813
deepseek-v4-pro
DeepSeek⁨US$ 1,32⁩⁨US$ 0,044⁩⁨US$ 3,96⁩1M2026-08-13
Grok 4.3
grok-4.3
xAI⁨US$ 1,25⁩*⁨US$ 0,20⁩⁨US$ 2,50⁩1M—
Muse Spark 1.3
muse-spark-1.3
Meta⁨US$ 1,25⁩⁨US$ 0,15⁩⁨US$ 4,25⁩1M2026-09-02
Amazon Nova 2 Propréviapreço de terceirosAmazon⁨US$ 1,25⁩—⁨US$ 10⁩——
Claude Haiku 4.5
claude-haiku-4-5-20251001
Anthropic⁨US$ 1⁩⁨US$ 0,10⁩⁨US$ 5⁩200K—
Grok Build 0.1
grok-build-0.1
xAI⁨US$ 1⁩*⁨US$ 0,20⁩⁨US$ 2⁩256K—
Gemini 3.8 Flash
gemini-3.8-flash
Google⁨US$ 0,75⁩⁨US$ 0,075⁩⁨US$ 3,75⁩1,05M2026-09-02
Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite
Google⁨US$ 0,30⁩⁨US$ 0,030⁩⁨US$ 2,50⁩1,05M2026-07-21
DeepSeek-V4.1-Flash
deepseek-flash
DeepSeek⁨US$ 0,30⁩⁨US$ 0,006⁩⁨US$ 1,20⁩1M2026-09-10
Amazon Nova 2 Litepreço de terceirosAmazon⁨US$ 0,30⁩—⁨US$ 2,50⁩1M2025-12-02
Qwen3.7-Plus
qwen3.7-plus
Alibaba Cloud (Qwen)⁨US$ 0,28⁩*⁨US$ 0,056⁩⁨US$ 1,10⁩1M2026-05-26
Mistral Small 4
mistral-small-2603
Mistral AI⁨US$ 0,15⁩—⁨US$ 0,60⁩256K2026-03-16
GLM-5.3-Flash
glm-5.3-flash
Z.ai (Zhipu)⁨US$ 0,15⁩⁨US$ 0,030⁩⁨US$ 0,50⁩1M—
GPT-6 Luna
gpt-6-luna
OpenAI⁨US$ 0,10⁩*⁨US$ 0,010⁩⁨US$ 0,50⁩1,05M2026-09-22
Qwen3.7-Flash
qwen3.7-flash
Alibaba Cloud (Qwen)⁨US$ 0,028⁩*⁨US$ 0,006⁩⁨US$ 0,11⁩1M2026-07-15

Dólares americanos por milhão de tokens, categoria padrão, preço para prompts curtos · * prompts longos custam mais

Calcule o custo da sua carga de trabalho

Como interpretar estes preços

O preço da entrada em cache é o que importa

Em um ciclo de agente, o prompt do sistema, as definições das ferramentas e as interações anteriores são reenviados a cada chamada. Os provedores cobram uma fração do preço normal de entrada quando esse prefixo é servido pelo cache, muitas vezes um décimo ou menos. Por isso, um modelo com cache barato pode sair mais em conta que outro com preço anunciado menor.

Prompts longos podem encarecer toda a chamada

OpenAI, a versão de prévia Pro do Google, xAI e Qwen cobram uma tarifa maior quando um único prompt ultrapassa um limite, como 200K ou 272K tokens. A tarifa maior se aplica a todos os tokens da solicitação. Atualmente, a Anthropic cobra pela janela completa de um milhão de tokens à tarifa padrão.

Tokens de raciocínio são cobrados como saída

Modelos que raciocinam antes de responder cobram o raciocínio oculto à tarifa de saída. Reduza o nível de esforço em etapas rotineiras e reserve as configurações mais altas para planejamento ou depuração difícil.

Descontos por lotes e fora do horário de pico raramente servem para agentes

Endpoints de processamento em lote reduzem o preço pela metade, mas levam horas para retornar resultados. São mais adequados para avaliações e cargas retroativas do que para agentes em tempo real. A tarifa fora do horário de pico da DeepSeek é uma exceção que pode funcionar para tarefas agendadas.

Dúvidas comuns de quem desenvolve agentes

Qual é o modelo mais barato para um agente de IA?

Na nossa carga de trabalho de programação com 30 etapas, os modelos mais baratos são os menores: GPT-6 Luna, Qwen3.7-Flash e GLM-5.3-Flash, cada um custando cerca de 10 a 20 centavos por tarefa. Um preço baixo por etapa não significa um custo baixo por tarefa se o modelo precisar de mais etapas ou tentativas. Portanto, teste duas ou três opções com seus próprios traces.

Por que meu agente custa muito mais do que o preço por token sugere?

Porque cada etapa reenvia a conversa, que fica cada vez maior. Uma tarefa com 30 etapas e um prompt inicial de 25K tokens envia, no total, bem mais de três milhões de tokens de entrada. O cache de prompts, respostas mais curtas das ferramentas e resumos das interações anteriores reduzem esse volume mais do que trocar de modelo.

Estes preços são definitivos?

São os preços de tabela em dólares americanos divulgados na página de preços de cada provedor em 1 October 2026, sem impostos, sobretaxas regionais ou descontos negociados. Os preços marcados como de terceiros não puderam ser verificados na página do próprio fornecedor.

Qual é a diferença entre entrada em cache e gravações no cache?

A leitura do cache é a tarifa com desconto para tokens que já estão no cache. Alguns provedores, entre eles a Anthropic, também cobram uma tarifa adicional na primeira vez que um prefixo é gravado no cache. A tabela mostra os preços de leitura; os preços de gravação são informados na página de cada modelo quando aplicável.

Referência independente para quem cria agentes de IA. Não temos vínculo com nenhum dos fornecedores mencionados aqui.

© 2026 DotsAgent · Fatos verificados em 1 de outubro de 2026