dotsagent.io
Lingua:Italiano
Sviluppo · prezzi verificati il 1 October 2026

Modelli e prezzi delle API per chi sviluppa agenti

Un agente paga ogni passaggio che esegue e la maggior parte dei costi riguarda input già inviati. Questa tabella mette a confronto prezzi di listino, sconti per la cache e limiti di contesto, così puoi scegliere un modello in base al costo dell'intera attività, non al prezzo in evidenza.

Tutti i modelli in un'unica tabella

Prezzi API dei modelli usati per creare agenti
Provider
GPT-6 Astra
gpt-6-astra
OpenAI⁨10 USD⁩*⁨1 USD⁩⁨50 USD⁩1,05M2026-09-08
Claude Fable 5.1
claude-fable-5-1
Anthropic⁨10 USD⁩⁨0,25 USD⁩⁨50 USD⁩1M2026-09-01
Claude Opus 5.5
claude-opus-5-5
Anthropic⁨4 USD⁩⁨0,20 USD⁩⁨20 USD⁩1M2026-09-22
Kimi K3
kimi-k3
Moonshot AI (Kimi)⁨3 USD⁩⁨0,30 USD⁩⁨15 USD⁩1,05M2026-07-16
Command A+prezzo di terze parti
command-a-plus-05-2026
Cohere⁨2,50 USD⁩—⁨10 USD⁩128K2026-05-20
GPT-6.1 Sol
gpt-6.1-sol
OpenAI⁨2 USD⁩*⁨0,10 USD⁩⁨10 USD⁩1,05M2026-09-29
Claude Sonnet 5.5
claude-sonnet-5-5
Anthropic⁨2 USD⁩⁨0,20 USD⁩⁨10 USD⁩1M2026-09-28
Gemini 3.1 Pro Previewanteprima
gemini-3.1-pro-preview
Google⁨2 USD⁩*⁨0,20 USD⁩⁨12 USD⁩1,05M2026-02-19
Grok 4.7
grok-4.7
xAI⁨2 USD⁩*⁨0,50 USD⁩⁨6 USD⁩500K2026-09-21
Qwen3.8-Max
qwen3.8-max
Alibaba Cloud (Qwen)⁨1,65 USD⁩⁨0,21 USD⁩⁨4,95 USD⁩1M2026-08-03
Gemini 3.5 Flash
gemini-3.5-flash
Google⁨1,50 USD⁩⁨0,15 USD⁩⁨9 USD⁩1,05M2026-05-19
Mistral Medium 3.5
mistral-medium-3-5
Mistral AI⁨1,50 USD⁩—⁨7,50 USD⁩256K2026-04-28
GLM-5.3
glm-5.3
Z.ai (Zhipu)⁨1,40 USD⁩⁨0,26 USD⁩⁨4,40 USD⁩1M2026-08-14
DeepSeek-V4-Pro-0813
deepseek-v4-pro
DeepSeek⁨1,32 USD⁩⁨0,044 USD⁩⁨3,96 USD⁩1M2026-08-13
Grok 4.3
grok-4.3
xAI⁨1,25 USD⁩*⁨0,20 USD⁩⁨2,50 USD⁩1M—
Muse Spark 1.3
muse-spark-1.3
Meta⁨1,25 USD⁩⁨0,15 USD⁩⁨4,25 USD⁩1M2026-09-02
Amazon Nova 2 Proanteprimaprezzo di terze partiAmazon⁨1,25 USD⁩—⁨10 USD⁩——
Claude Haiku 4.5
claude-haiku-4-5-20251001
Anthropic⁨1 USD⁩⁨0,10 USD⁩⁨5 USD⁩200K—
Grok Build 0.1
grok-build-0.1
xAI⁨1 USD⁩*⁨0,20 USD⁩⁨2 USD⁩256K—
Gemini 3.8 Flash
gemini-3.8-flash
Google⁨0,75 USD⁩⁨0,075 USD⁩⁨3,75 USD⁩1,05M2026-09-02
Gemini 3.5 Flash-Lite
gemini-3.5-flash-lite
Google⁨0,30 USD⁩⁨0,030 USD⁩⁨2,50 USD⁩1,05M2026-07-21
DeepSeek-V4.1-Flash
deepseek-flash
DeepSeek⁨0,30 USD⁩⁨0,006 USD⁩⁨1,20 USD⁩1M2026-09-10
Amazon Nova 2 Liteprezzo di terze partiAmazon⁨0,30 USD⁩—⁨2,50 USD⁩1M2025-12-02
Qwen3.7-Plus
qwen3.7-plus
Alibaba Cloud (Qwen)⁨0,28 USD⁩*⁨0,056 USD⁩⁨1,10 USD⁩1M2026-05-26
Mistral Small 4
mistral-small-2603
Mistral AI⁨0,15 USD⁩—⁨0,60 USD⁩256K2026-03-16
GLM-5.3-Flash
glm-5.3-flash
Z.ai (Zhipu)⁨0,15 USD⁩⁨0,030 USD⁩⁨0,50 USD⁩1M—
GPT-6 Luna
gpt-6-luna
OpenAI⁨0,10 USD⁩*⁨0,010 USD⁩⁨0,50 USD⁩1,05M2026-09-22
Qwen3.7-Flash
qwen3.7-flash
Alibaba Cloud (Qwen)⁨0,028 USD⁩*⁨0,006 USD⁩⁨0,11 USD⁩1M2026-07-15

Dollari USA per milione di token, fascia standard, tariffa per prompt brevi · * i prompt lunghi costano di più

Calcola il costo del tuo carico di lavoro

Come leggere questi prezzi

Il dato che conta è l'input in cache

In un ciclo di un agente, il prompt di sistema, le definizioni degli strumenti e i turni precedenti vengono reinviati a ogni chiamata. Se quel prefisso viene servito dalla cache, i provider applicano una frazione della tariffa standard per l'input, spesso un decimo o meno. Perciò un modello con una cache economica può costare meno di uno con un prezzo in evidenza inferiore.

I prompt lunghi possono aumentare il costo di tutta la chiamata

OpenAI, l'anteprima Pro di Google, xAI e Qwen applicano una tariffa più alta quando un singolo prompt supera una soglia, ad esempio 200K o 272K token. La tariffa maggiorata si applica a tutti i token della richiesta. Al momento Anthropic fattura l'intera finestra da un milione di token alla tariffa standard.

I token di ragionamento vengono fatturati come output

I modelli che ragionano prima di rispondere fatturano il ragionamento nascosto alla tariffa dell'output. Riduci il livello di ragionamento per i passaggi di routine e mantienilo alto per la pianificazione o il debugging complesso.

Gli sconti batch e fuori orario raramente sono adatti agli agenti

Gli endpoint batch dimezzano il prezzo, ma restituiscono i risultati nel giro di ore: sono adatti alle valutazioni e ai backfill, non agli agenti in tempo reale. La tariffa fuori orario di DeepSeek è un'eccezione utile per i job pianificati.

Domande frequenti tra chi sviluppa agenti

Qual è il modello meno costoso per un agente AI?

Nel nostro carico di lavoro di coding da 30 passaggi, i modelli meno costosi sono quelli più piccoli: GPT-6 Luna, Qwen3.7-Flash e GLM-5.3-Flash, ciascuno con un costo di circa 10 to 20 cents per attività. Un costo basso per passaggio non significa un costo basso per attività se il modello richiede più passaggi o tentativi. Prova due o tre modelli candidati sulle tue tracce.

Perché il mio agente costa molto più di quanto suggerisca il prezzo per token?

Perché a ogni passaggio viene reinviata la conversazione, che continua a crescere. Un'attività da 30 passaggi con un prompt iniziale di 25K token invia in totale ben più di tre milioni di token di input. La cache dei prompt, output degli strumenti più brevi e i riepiloghi dei turni precedenti riducono i costi più del cambio di modello.

Questi sono i prezzi definitivi?

Sono i prezzi di listino in dollari statunitensi indicati nelle pagine dei prezzi dei provider il 1 October 2026, al netto di imposte, maggiorazioni regionali o sconti negoziati. Non è stato possibile verificare i prezzi contrassegnati come di terze parti sulle pagine ufficiali dei fornitori.

Qual è la differenza tra input in cache e scritture in cache?

La lettura dalla cache è la tariffa scontata per i token già presenti nella cache. Alcuni provider, tra cui Anthropic, applicano anche un sovrapprezzo la prima volta che un prefisso viene scritto nella cache. La tabella mostra i prezzi di lettura; i prezzi di scrittura sono indicati nella pagina di ciascun modello, quando applicabili.