dotsagent.io
Langue:Français
Créer · outil

Calculateur de coût d’agent

Un agent fonctionne en boucle : chaque appel renvoie tout le contexte accumulé, ainsi que le dernier résultat d’outil. Décrivez cette boucle une fois pour connaître le coût d’une tâche et d’un mois de tâches avec chaque modèle de notre tableau des prix.

Partir d’une charge de travail

Lit des fichiers, modifie du code et lance des tests dans un repository. Le prompt système, volumineux, contient les schémas des outils ; chaque étape ajoute un fichier ou un journal de test.

Une tâche envoie 3 360 000 tokens en entrée et reçoit 36 000 tokens en sortie. Le plus grand prompt contient 199 000 tokens.

Coût estimé par tâche et par mois pour chaque modèle
ModèlePar tâche30 jours à raison de 50 par jour
GPT-6 Luna · OpenAI⁨0,099 $US⁩⁨148 $US⁩
Qwen3.7-Flash · Alibaba Cloud (Qwen)28 appels au tarif des prompts longs⁨0,101 $US⁩⁨152 $US⁩
GLM-5.3-Flash · Z.ai (Zhipu)⁨0,182 $US⁩⁨273 $US⁩
DeepSeek-V4.1-Flash · DeepSeek⁨0,218 $US⁩⁨327 $US⁩
Gemini 3.5 Flash-Lite · Google⁨0,333 $US⁩⁨499 $US⁩
Qwen3.7-Plus · Alibaba Cloud (Qwen)⁨0,343 $US⁩⁨515 $US⁩
Mistral Small 4 · Mistral AI⁨0,526 $US⁩⁨788 $US⁩
Gemini 3.8 Flash · Google⁨0,742 $US⁩⁨1 112 $US⁩
DeepSeek-V4-Pro-0813 · DeepSeek⁨0,961 $US⁩⁨1 441 $US⁩
Claude Haiku 4.5 · Anthropic⁨0,989 $US⁩⁨1 483 $US⁩
Amazon Nova 2 Lite · Amazontarif d'un tiers⁨1,10 $US⁩⁨1 647 $US⁩
Grok Build 0.1 · xAI⁨1,16 $US⁩⁨1 746 $US⁩
Muse Spark 1.3 · Meta⁨1,23 $US⁩⁨1 852 $US⁩
Grok 4.3 · xAI⁨1,31 $US⁩⁨1 970 $US⁩
Gemini 3.5 Flash · Google⁨1,54 $US⁩⁨2 306 $US⁩
Qwen3.8-Max · Alibaba Cloud (Qwen)⁨1,63 $US⁩⁨2 443 $US⁩
GLM-5.3 · Z.ai (Zhipu)⁨1,63 $US⁩⁨2 446 $US⁩
GPT-6.1 Sol · OpenAI⁨1,69 $US⁩⁨2 541 $US⁩
Claude Sonnet 5.5 · Anthropic⁨1,98 $US⁩⁨2 966 $US⁩
Gemini 3.1 Pro Preview · Google⁨2,05 $US⁩⁨3 074 $US⁩
Grok 4.7 · xAI⁨2,68 $US⁩⁨4 026 $US⁩
Kimi K3 · Moonshot AI (Kimi)⁨2,97 $US⁩⁨4 449 $US⁩
Claude Opus 5.5 · Anthropic⁨3,39 $US⁩⁨5 082 $US⁩
Amazon Nova 2 Pro · Amazontarif d'un tiers⁨4,56 $US⁩⁨6 840 $US⁩
Mistral Medium 3.5 · Mistral AI⁨5,31 $US⁩⁨7 965 $US⁩
Claude Fable 5.1 · Anthropic⁨7,76 $US⁩⁨11 642 $US⁩
Command A+ · Coheredépasse la fenêtre de contextetarif d'un tiers⁨8,76 $US⁩⁨13 140 $US⁩
GPT-6 Astra · OpenAI⁨9,89 $US⁩⁨14 831 $US⁩

Tarifs publics, offre standard, en dollars américains. Les écritures dans le cache, les taxes, les frais liés aux outils comme la recherche Web et les suppléments régionaux ne sont pas inclus.

Méthode de calcul

Pour chaque appel de la boucle, nous prenons la taille du prompt — le premier prompt auquel s’ajoute la croissance de chaque étape précédente — et la répartissons entre une part mise en cache et une part nouvelle. Le premier appel est toujours entièrement nouveau. Les tokens nouveaux sont facturés au tarif d’entrée, les tokens mis en cache au tarif du cache, et les tokens de sortie au tarif de sortie.

Si un prompt dépasse le seuil de contexte long d’un fournisseur, l’appel entier est facturé au tarif des prompts longs, comme le font OpenAI, Google, xAI et Qwen. Si le plus grand prompt dépasse la fenêtre de contexte du modèle, la ligne est signalée, car un agent réel devrait d’abord réduire ou résumer son historique.

Les agents réels varient d’une tâche à l’autre, réessaient les étapes échouées et s’arrêtent parfois plus tôt. Utilisez ces chiffres pour comparer les modèles sur une même charge de travail, puis mesurez le nombre réel de tokens à partir de vos propres traces avant d’établir votre budget.

Questions sur le coût des agents

Combien de tokens un agent IA utilise-t-il par tâche ?

Cela dépend surtout du nombre d’étapes et de la quantité de contenu ajoutée à chaque étape. Un bref échange avec le support peut utiliser 30K tokens en entrée ; une tâche de programmation de 30 étapes avec un prompt initial de 25K tokens envoie plus de trois millions de tokens, car l’historique complet est renvoyé à chaque appel.

Comment réduire le coût d’un agent ?

Gardez le début du prompt identique d’un appel à l’autre pour qu’il soit mis en cache, limitez les résultats des outils au strict nécessaire pour le modèle, résumez ou supprimez les anciens échanges, utilisez un petit modèle pour les étapes courantes et un grand modèle uniquement pour la planification, et réduisez l’effort de raisonnement lorsque la qualité le permet.

La mise en cache des prompts est-elle automatique ?

Avec OpenAI, DeepSeek, Kimi et la mise en cache implicite de Gemini, oui, lorsque les prompts partagent un préfixe long. Anthropic et certains endpoints Qwen nécessitent des marqueurs de cache explicites, et Anthropic facture un supplément pour la première écriture.

Pourquoi le modèle le moins cher par token n’est-il pas le moins cher par tâche ?

Les remises liées au cache varient selon les modèles, certains fournisseurs facturent les prompts longs à un tarif supérieur, et les modèles de raisonnement consomment des tokens de sortie pour réfléchir. Un modèle qui nécessite moins d’étapes ou moins de nouvelles tentatives peut aussi être plus avantageux, mais cette calculatrice ne peut pas en tenir compte.