Modelos e preços de API para criar agentes
Um agente paga por cada etapa que executa, e a maior parte do custo vem de dados de entrada que ele já enviou. Esta tabela compara preços de tabela, descontos de cache e limites de contexto para que você escolha um modelo pelo custo da tarefa inteira, não pelo preço anunciado.
Todos os modelos em uma tabela
| Provedor | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | US$ 10* | US$ 1 | US$ 50 | 1,05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | US$ 10 | US$ 0,25 | US$ 50 | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | US$ 4 | US$ 0,20 | US$ 20 | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | US$ 3 | US$ 0,30 | US$ 15 | 1,05M | 2026-07-16 |
| Command A+preço de terceiros | Cohere | US$ 2,50 | — | US$ 10 | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | US$ 2* | US$ 0,10 | US$ 10 | 1,05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | US$ 2 | US$ 0,20 | US$ 10 | 1M | 2026-09-28 |
| Gemini 3.1 Pro Previewprévia | US$ 2* | US$ 0,20 | US$ 12 | 1,05M | 2026-02-19 | |
| Grok 4.7 | xAI | US$ 2* | US$ 0,50 | US$ 6 | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | US$ 1,65 | US$ 0,21 | US$ 4,95 | 1M | 2026-08-03 |
| Gemini 3.5 Flash | US$ 1,50 | US$ 0,15 | US$ 9 | 1,05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | US$ 1,50 | — | US$ 7,50 | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | US$ 1,40 | US$ 0,26 | US$ 4,40 | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | US$ 1,32 | US$ 0,044 | US$ 3,96 | 1M | 2026-08-13 |
| Grok 4.3 | xAI | US$ 1,25* | US$ 0,20 | US$ 2,50 | 1M | — |
| Muse Spark 1.3 | Meta | US$ 1,25 | US$ 0,15 | US$ 4,25 | 1M | 2026-09-02 |
| Amazon Nova 2 Propréviapreço de terceiros | Amazon | US$ 1,25 | — | US$ 10 | — | — |
| Claude Haiku 4.5 | Anthropic | US$ 1 | US$ 0,10 | US$ 5 | 200K | — |
| Grok Build 0.1 | xAI | US$ 1* | US$ 0,20 | US$ 2 | 256K | — |
| Gemini 3.8 Flash | US$ 0,75 | US$ 0,075 | US$ 3,75 | 1,05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | US$ 0,30 | US$ 0,030 | US$ 2,50 | 1,05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | US$ 0,30 | US$ 0,006 | US$ 1,20 | 1M | 2026-09-10 |
| Amazon Nova 2 Litepreço de terceiros | Amazon | US$ 0,30 | — | US$ 2,50 | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | US$ 0,28* | US$ 0,056 | US$ 1,10 | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | US$ 0,15 | — | US$ 0,60 | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | US$ 0,15 | US$ 0,030 | US$ 0,50 | 1M | — |
| GPT-6 Luna | OpenAI | US$ 0,10* | US$ 0,010 | US$ 0,50 | 1,05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | US$ 0,028* | US$ 0,006 | US$ 0,11 | 1M | 2026-07-15 |
Calcule o custo da sua carga de trabalho
Como interpretar estes preços
O preço da entrada em cache é o que importa
Em um ciclo de agente, o prompt do sistema, as definições das ferramentas e as interações anteriores são reenviados a cada chamada. Os provedores cobram uma fração do preço normal de entrada quando esse prefixo é servido pelo cache, muitas vezes um décimo ou menos. Por isso, um modelo com cache barato pode sair mais em conta que outro com preço anunciado menor.
Prompts longos podem encarecer toda a chamada
OpenAI, a versão de prévia Pro do Google, xAI e Qwen cobram uma tarifa maior quando um único prompt ultrapassa um limite, como 200K ou 272K tokens. A tarifa maior se aplica a todos os tokens da solicitação. Atualmente, a Anthropic cobra pela janela completa de um milhão de tokens à tarifa padrão.
Tokens de raciocínio são cobrados como saída
Modelos que raciocinam antes de responder cobram o raciocínio oculto à tarifa de saída. Reduza o nível de esforço em etapas rotineiras e reserve as configurações mais altas para planejamento ou depuração difícil.
Descontos por lotes e fora do horário de pico raramente servem para agentes
Endpoints de processamento em lote reduzem o preço pela metade, mas levam horas para retornar resultados. São mais adequados para avaliações e cargas retroativas do que para agentes em tempo real. A tarifa fora do horário de pico da DeepSeek é uma exceção que pode funcionar para tarefas agendadas.
Dúvidas comuns de quem desenvolve agentes
Qual é o modelo mais barato para um agente de IA?
Na nossa carga de trabalho de programação com 30 etapas, os modelos mais baratos são os menores: GPT-6 Luna, Qwen3.7-Flash e GLM-5.3-Flash, cada um custando cerca de 10 a 20 centavos por tarefa. Um preço baixo por etapa não significa um custo baixo por tarefa se o modelo precisar de mais etapas ou tentativas. Portanto, teste duas ou três opções com seus próprios traces.
Por que meu agente custa muito mais do que o preço por token sugere?
Porque cada etapa reenvia a conversa, que fica cada vez maior. Uma tarefa com 30 etapas e um prompt inicial de 25K tokens envia, no total, bem mais de três milhões de tokens de entrada. O cache de prompts, respostas mais curtas das ferramentas e resumos das interações anteriores reduzem esse volume mais do que trocar de modelo.
Estes preços são definitivos?
São os preços de tabela em dólares americanos divulgados na página de preços de cada provedor em 1 October 2026, sem impostos, sobretaxas regionais ou descontos negociados. Os preços marcados como de terceiros não puderam ser verificados na página do próprio fornecedor.
Qual é a diferença entre entrada em cache e gravações no cache?
A leitura do cache é a tarifa com desconto para tokens que já estão no cache. Alguns provedores, entre eles a Anthropic, também cobram uma tarifa adicional na primeira vez que um prefixo é gravado no cache. A tabela mostra os preços de leitura; os preços de gravação são informados na página de cada modelo quando aplicável.