Calculateur de coût d’agent
Un agent fonctionne en boucle : chaque appel renvoie tout le contexte accumulé, ainsi que le dernier résultat d’outil. Décrivez cette boucle une fois pour connaître le coût d’une tâche et d’un mois de tâches avec chaque modèle de notre tableau des prix.
| Modèle | Par tâche | 30 jours à raison de 50 par jour |
|---|---|---|
| GPT-6 Luna | 0,099 $US | 148 $US |
| Qwen3.7-Flash28 appels au tarif des prompts longs | 0,101 $US | 152 $US |
| GLM-5.3-Flash | 0,182 $US | 273 $US |
| DeepSeek-V4.1-Flash | 0,218 $US | 327 $US |
| Gemini 3.5 Flash-Lite | 0,333 $US | 499 $US |
| Qwen3.7-Plus | 0,343 $US | 515 $US |
| Mistral Small 4 | 0,526 $US | 788 $US |
| Gemini 3.8 Flash | 0,742 $US | 1 112 $US |
| DeepSeek-V4-Pro-0813 | 0,961 $US | 1 441 $US |
| Claude Haiku 4.5 | 0,989 $US | 1 483 $US |
| Amazon Nova 2 Litetarif d'un tiers | 1,10 $US | 1 647 $US |
| Grok Build 0.1 | 1,16 $US | 1 746 $US |
| Muse Spark 1.3 | 1,23 $US | 1 852 $US |
| Grok 4.3 | 1,31 $US | 1 970 $US |
| Gemini 3.5 Flash | 1,54 $US | 2 306 $US |
| Qwen3.8-Max | 1,63 $US | 2 443 $US |
| GLM-5.3 | 1,63 $US | 2 446 $US |
| GPT-6.1 Sol | 1,69 $US | 2 541 $US |
| Claude Sonnet 5.5 | 1,98 $US | 2 966 $US |
| Gemini 3.1 Pro Preview | 2,05 $US | 3 074 $US |
| Grok 4.7 | 2,68 $US | 4 026 $US |
| Kimi K3 | 2,97 $US | 4 449 $US |
| Claude Opus 5.5 | 3,39 $US | 5 082 $US |
| Amazon Nova 2 Protarif d'un tiers | 4,56 $US | 6 840 $US |
| Mistral Medium 3.5 | 5,31 $US | 7 965 $US |
| Claude Fable 5.1 | 7,76 $US | 11 642 $US |
| Command A+dépasse la fenêtre de contextetarif d'un tiers | 8,76 $US | 13 140 $US |
| GPT-6 Astra | 9,89 $US | 14 831 $US |
Méthode de calcul
Pour chaque appel de la boucle, nous prenons la taille du prompt — le premier prompt auquel s’ajoute la croissance de chaque étape précédente — et la répartissons entre une part mise en cache et une part nouvelle. Le premier appel est toujours entièrement nouveau. Les tokens nouveaux sont facturés au tarif d’entrée, les tokens mis en cache au tarif du cache, et les tokens de sortie au tarif de sortie.
Si un prompt dépasse le seuil de contexte long d’un fournisseur, l’appel entier est facturé au tarif des prompts longs, comme le font OpenAI, Google, xAI et Qwen. Si le plus grand prompt dépasse la fenêtre de contexte du modèle, la ligne est signalée, car un agent réel devrait d’abord réduire ou résumer son historique.
Les agents réels varient d’une tâche à l’autre, réessaient les étapes échouées et s’arrêtent parfois plus tôt. Utilisez ces chiffres pour comparer les modèles sur une même charge de travail, puis mesurez le nombre réel de tokens à partir de vos propres traces avant d’établir votre budget.
Questions sur le coût des agents
Combien de tokens un agent IA utilise-t-il par tâche ?
Cela dépend surtout du nombre d’étapes et de la quantité de contenu ajoutée à chaque étape. Un bref échange avec le support peut utiliser 30K tokens en entrée ; une tâche de programmation de 30 étapes avec un prompt initial de 25K tokens envoie plus de trois millions de tokens, car l’historique complet est renvoyé à chaque appel.
Comment réduire le coût d’un agent ?
Gardez le début du prompt identique d’un appel à l’autre pour qu’il soit mis en cache, limitez les résultats des outils au strict nécessaire pour le modèle, résumez ou supprimez les anciens échanges, utilisez un petit modèle pour les étapes courantes et un grand modèle uniquement pour la planification, et réduisez l’effort de raisonnement lorsque la qualité le permet.
La mise en cache des prompts est-elle automatique ?
Avec OpenAI, DeepSeek, Kimi et la mise en cache implicite de Gemini, oui, lorsque les prompts partagent un préfixe long. Anthropic et certains endpoints Qwen nécessitent des marqueurs de cache explicites, et Anthropic facture un supplément pour la première écriture.
Pourquoi le modèle le moins cher par token n’est-il pas le moins cher par tâche ?
Les remises liées au cache varient selon les modèles, certains fournisseurs facturent les prompts longs à un tarif supérieur, et les modèles de raisonnement consomment des tokens de sortie pour réfléchir. Un modèle qui nécessite moins d’étapes ou moins de nouvelles tentatives peut aussi être plus avantageux, mais cette calculatrice ne peut pas en tenir compte.