Calcolatore dei costi degli agenti
Un agente funziona in un ciclo: a ogni chiamata reinvia tutto ciò che è stato elaborato finora, insieme al risultato più recente del tool. Descrivi il ciclo una volta sola e scopri quanto costa un'attività, o un mese di attività, con ciascun modello della nostra tabella dei prezzi.
| Modello | Per attività | 30 giorni a 50 al giorno |
|---|---|---|
| GPT-6 Luna | 0,099 USD | 148 USD |
| Qwen3.7-Flash28 chiamate alla tariffa per prompt lunghi | 0,101 USD | 152 USD |
| GLM-5.3-Flash | 0,182 USD | 273 USD |
| DeepSeek-V4.1-Flash | 0,218 USD | 327 USD |
| Gemini 3.5 Flash-Lite | 0,333 USD | 499 USD |
| Qwen3.7-Plus | 0,343 USD | 515 USD |
| Mistral Small 4 | 0,526 USD | 788 USD |
| Gemini 3.8 Flash | 0,742 USD | 1112 USD |
| DeepSeek-V4-Pro-0813 | 0,961 USD | 1441 USD |
| Claude Haiku 4.5 | 0,989 USD | 1483 USD |
| Amazon Nova 2 Liteprezzo di terze parti | 1,10 USD | 1647 USD |
| Grok Build 0.1 | 1,16 USD | 1746 USD |
| Muse Spark 1.3 | 1,23 USD | 1852 USD |
| Grok 4.3 | 1,31 USD | 1970 USD |
| Gemini 3.5 Flash | 1,54 USD | 2306 USD |
| Qwen3.8-Max | 1,63 USD | 2443 USD |
| GLM-5.3 | 1,63 USD | 2446 USD |
| GPT-6.1 Sol | 1,69 USD | 2541 USD |
| Claude Sonnet 5.5 | 1,98 USD | 2966 USD |
| Gemini 3.1 Pro Preview | 2,05 USD | 3074 USD |
| Grok 4.7 | 2,68 USD | 4026 USD |
| Kimi K3 | 2,97 USD | 4449 USD |
| Claude Opus 5.5 | 3,39 USD | 5082 USD |
| Amazon Nova 2 Proprezzo di terze parti | 4,56 USD | 6840 USD |
| Mistral Medium 3.5 | 5,31 USD | 7965 USD |
| Claude Fable 5.1 | 7,76 USD | 11.642 USD |
| Command A+supera la finestra di contestoprezzo di terze parti | 8,76 USD | 13.140 USD |
| GPT-6 Astra | 9,89 USD | 14.831 USD |
Come funziona la stima
Per ogni chiamata nel ciclo consideriamo la dimensione del prompt, composta dal prompt iniziale e dalla crescita dovuta a ogni passaggio precedente, e la suddividiamo in una parte memorizzata nella cache e una nuova. La prima chiamata è sempre nuova. I token nuovi sono fatturati alla tariffa di input, quelli in cache alla tariffa per i token memorizzati e l'output alla tariffa di output.
Se un singolo prompt supera la soglia di contesto lungo del provider, l'intera chiamata è fatturata alla tariffa per prompt lunghi, come avviene con OpenAI, Google, xAI e Qwen. Se il prompt più lungo supera la finestra di contesto del modello, la riga viene segnalata: un agente reale dovrebbe prima ridurre o riassumere la cronologia.
Gli agenti reali variano da un'attività all'altra, riprovano i passaggi non riusciti e a volte si fermano in anticipo. Usa questi dati per confrontare i modelli sullo stesso carico di lavoro, poi misura il numero effettivo di token dai tuoi trace prima di definire il budget.
Domande sui costi degli agenti
Quanti token usa un agente AI per attività?
Dipende soprattutto dal numero di passaggi e da quanto aggiunge ciascuno. Un breve scambio di assistenza può usare 30K token di input; un'attività di coding di 30 passaggi con un prompt iniziale di 25K token ne invia oltre tre milioni, perché a ogni chiamata viene reinviata l'intera cronologia.
Come posso ridurre il costo di un agente?
Mantieni identico l'inizio del prompt tra le chiamate, così viene memorizzato nella cache; riduci i risultati degli strumenti a ciò che serve al modello; riassumi o elimina i turni meno recenti; usa un modello piccolo per i passaggi di routine e uno grande solo per la pianificazione; riduci il livello di ragionamento quando la qualità lo consente.
La memorizzazione dei prompt nella cache avviene automaticamente?
Con OpenAI, DeepSeek, Kimi e la cache implicita di Gemini, sì, quando i prompt condividono un prefisso lungo. Anthropic e alcuni endpoint Qwen richiedono marcatori di cache espliciti; Anthropic applica un costo aggiuntivo alla prima scrittura.
Perché il modello meno costoso per token non è il più economico per attività?
Gli sconti sulla cache variano da un modello all'altro, alcuni provider applicano una tariffa più alta ai prompt lunghi e i modelli di ragionamento consumano token di output per pensare. Può anche convenire un modello che richiede meno passaggi o meno tentativi, un aspetto che questo calcolatore non può valutare.