Modèles et tarifs des API pour concevoir des agents
Un agent paie chaque étape qu’il exécute, et l’essentiel de ses dépenses concerne des entrées qu’il a déjà envoyées. Ce tableau compare les tarifs catalogue, les réductions liées au cache et les limites de contexte pour vous aider à choisir un modèle selon le coût d’une tâche complète, et non selon le tarif affiché.
Tous les modèles dans un seul tableau
| Fournisseur | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 10 $US* | 1 $US | 50 $US | 1,05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | 10 $US | 0,25 $US | 50 $US | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | 4 $US | 0,20 $US | 20 $US | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | 3 $US | 0,30 $US | 15 $US | 1,05M | 2026-07-16 |
| Command A+tarif d'un tiers | Cohere | 2,50 $US | — | 10 $US | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | 2 $US* | 0,10 $US | 10 $US | 1,05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | 2 $US | 0,20 $US | 10 $US | 1M | 2026-09-28 |
| Gemini 3.1 Pro Previewaperçu | 2 $US* | 0,20 $US | 12 $US | 1,05M | 2026-02-19 | |
| Grok 4.7 | xAI | 2 $US* | 0,50 $US | 6 $US | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | 1,65 $US | 0,21 $US | 4,95 $US | 1M | 2026-08-03 |
| Gemini 3.5 Flash | 1,50 $US | 0,15 $US | 9 $US | 1,05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | 1,50 $US | — | 7,50 $US | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | 1,40 $US | 0,26 $US | 4,40 $US | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | 1,32 $US | 0,044 $US | 3,96 $US | 1M | 2026-08-13 |
| Grok 4.3 | xAI | 1,25 $US* | 0,20 $US | 2,50 $US | 1M | — |
| Muse Spark 1.3 | Meta | 1,25 $US | 0,15 $US | 4,25 $US | 1M | 2026-09-02 |
| Amazon Nova 2 Proaperçutarif d'un tiers | Amazon | 1,25 $US | — | 10 $US | — | — |
| Claude Haiku 4.5 | Anthropic | 1 $US | 0,10 $US | 5 $US | 200K | — |
| Grok Build 0.1 | xAI | 1 $US* | 0,20 $US | 2 $US | 256K | — |
| Gemini 3.8 Flash | 0,75 $US | 0,075 $US | 3,75 $US | 1,05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | 0,30 $US | 0,030 $US | 2,50 $US | 1,05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | 0,30 $US | 0,006 $US | 1,20 $US | 1M | 2026-09-10 |
| Amazon Nova 2 Litetarif d'un tiers | Amazon | 0,30 $US | — | 2,50 $US | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | 0,28 $US* | 0,056 $US | 1,10 $US | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | 0,15 $US | — | 0,60 $US | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | 0,15 $US | 0,030 $US | 0,50 $US | 1M | — |
| GPT-6 Luna | OpenAI | 0,10 $US* | 0,010 $US | 0,50 $US | 1,05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | 0,028 $US* | 0,006 $US | 0,11 $US | 1M | 2026-07-15 |
Estimez le coût de votre charge
Comment lire ces tarifs
Le tarif des entrées en cache est déterminant
Dans une boucle d’agent, le prompt système, les définitions des outils et les échanges précédents sont renvoyés à chaque appel. Les fournisseurs facturent une fraction du tarif d’entrée normal lorsque ce préfixe est servi depuis le cache, souvent un dixième ou moins. Un modèle avec un cache peu coûteux peut donc revenir moins cher qu’un modèle au tarif affiché inférieur.
Un prompt long peut modifier le tarif de tout l’appel
OpenAI, l’aperçu Pro de Google, xAI et Qwen appliquent un tarif supérieur lorsqu’un prompt dépasse un seuil, par exemple 200K ou 272K tokens. Ce tarif supérieur s’applique alors à tous les tokens de la requête. Anthropic facture actuellement l’intégralité de sa fenêtre d’un million de tokens au tarif standard.
Les tokens de raisonnement sont facturés comme des sorties
Les modèles qui réfléchissent avant de répondre facturent leur raisonnement masqué au tarif de sortie. Réduisez le niveau d’effort pour les étapes courantes et réservez les niveaux élevés à la planification ou au débogage complexe.
Les réductions pour le traitement par lots et les heures creuses conviennent rarement aux agents
Les endpoints de traitement par lots divisent le prix par deux, mais les résultats arrivent en quelques heures : cette option convient aux évaluations et au traitement de données historiques, plutôt qu’aux agents en temps réel. Le tarif hors heures de pointe de DeepSeek est une exception qui peut convenir aux tâches planifiées.
Questions fréquentes des développeurs
Quel est le modèle le moins cher pour un agent IA ?
Pour notre tâche de programmation en 30 étapes, les modèles les moins chers sont des modèles compacts : GPT-6 Luna, Qwen3.7-Flash et GLM-5.3-Flash, qui coûtent chacun environ 10 à 20 cents par tâche. Un faible coût par étape ne garantit pas un faible coût par tâche si le modèle nécessite davantage d’étapes ou de nouvelles tentatives. Testez donc deux ou trois candidats avec vos propres traces.
Pourquoi mon agent coûte-t-il beaucoup plus cher que ne le laisse penser le tarif par token ?
Parce que chaque étape renvoie la conversation, qui s’allonge au fil des échanges. Une tâche de 30 étapes avec un prompt initial de 25K tokens envoie au total bien plus de trois millions de tokens d’entrée. La mise en cache des prompts, la réduction des sorties des outils et la synthèse des anciens échanges permettent de réduire ce volume davantage que le changement de modèle.
Ces tarifs sont-ils définitifs ?
Il s’agit des tarifs catalogue en dollars américains publiés sur la page tarifaire de chaque fournisseur le 1 octobre 2026, hors taxes, suppléments régionaux et remises négociées. Les tarifs signalés comme provenant d’un tiers n’étaient pas consultables sur la page du fournisseur.
Quelle est la différence entre les entrées mises en cache et l’écriture dans le cache ?
Une lecture du cache correspond au tarif réduit appliqué aux tokens déjà présents dans le cache. Certains fournisseurs, dont Anthropic, facturent également un supplément lors de la première écriture d’un préfixe dans le cache. Le tableau indique les tarifs de lecture ; les tarifs d’écriture sont précisés sur la page de chaque modèle lorsqu’ils s’appliquent.