Mga modelo at presyo ng API para sa mga gumagawa ng agent
May bayad ang bawat hakbang ng isang agent, at karamihan sa binabayaran nito ay input na naipadala na nito. Pinagtatabi ng talahanayang ito ang mga list price, diskuwento sa cache at limitasyon ng context para mapili mo ang modelo batay sa halaga ng buong task, hindi sa presyong ipinapakita sa unang tingin.
Lahat ng modelo sa iisang talahanayan
| Provider | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | $10* | $1 | $50 | 1.05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | $10 | $0.25 | $50 | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | $4 | $0.20 | $20 | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | $3 | $0.30 | $15 | 1.05M | 2026-07-16 |
| Command A+presyo mula sa third party | Cohere | $2.50 | — | $10 | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | $2* | $0.10 | $10 | 1.05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | $2 | $0.20 | $10 | 1M | 2026-09-28 |
| Gemini 3.1 Pro Previewpreview | $2* | $0.20 | $12 | 1.05M | 2026-02-19 | |
| Grok 4.7 | xAI | $2* | $0.50 | $6 | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | $1.65 | $0.21 | $4.95 | 1M | 2026-08-03 |
| Gemini 3.5 Flash | $1.50 | $0.15 | $9 | 1.05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | $1.50 | — | $7.50 | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | $1.40 | $0.26 | $4.40 | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | $1.32 | $0.044 | $3.96 | 1M | 2026-08-13 |
| Grok 4.3 | xAI | $1.25* | $0.20 | $2.50 | 1M | — |
| Muse Spark 1.3 | Meta | $1.25 | $0.15 | $4.25 | 1M | 2026-09-02 |
| Amazon Nova 2 Propreviewpresyo mula sa third party | Amazon | $1.25 | — | $10 | — | — |
| Claude Haiku 4.5 | Anthropic | $1 | $0.10 | $5 | 200K | — |
| Grok Build 0.1 | xAI | $1* | $0.20 | $2 | 256K | — |
| Gemini 3.8 Flash | $0.75 | $0.075 | $3.75 | 1.05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | $0.30 | $0.030 | $2.50 | 1.05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | $0.30 | $0.006 | $1.20 | 1M | 2026-09-10 |
| Amazon Nova 2 Litepresyo mula sa third party | Amazon | $0.30 | — | $2.50 | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | $0.28* | $0.056 | $1.10 | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | $0.15 | — | $0.60 | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | $0.15 | $0.030 | $0.50 | 1M | — |
| GPT-6 Luna | OpenAI | $0.10* | $0.010 | $0.50 | 1.05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | $0.028* | $0.006 | $0.11 | 1M | 2026-07-15 |
Kalkulahin ang presyo ng sarili mong workload
Paano basahin ang mga presyong ito
Presyo ng naka-cache na input ang dapat tingnan
Sa agent loop, muling ipinapadala sa bawat tawag ang system prompt, mga tool definition at mga naunang turn. Mas mababa ang singil ng mga provider para sa prefix na kinukuha mula sa cache—madalas ay ikasampu o mas mababa pa ng karaniwang presyo ng input. Kaya maaaring mas mura ang modelong mura ang cache kaysa sa modelong mas mababa ang presyong nakikita sa unang tingin.
Maaaring tumaas ang presyo ng buong tawag kapag mahaba ang prompt
Mas mataas ang singil ng OpenAI, Google's Pro preview, xAI at Qwen kapag lumampas sa threshold na gaya ng 200K o 272K token ang isang prompt, at ilalapat ang mas mataas na presyo sa bawat token sa request na iyon. Sa kasalukuyan, karaniwang presyo ang singil ng Anthropic para sa buong isang milyong token na context window nito.
Sinisingil bilang output ang mga reasoning token
Sinisingil sa presyo ng output ang nakatagong reasoning ng mga modelong nag-iisip bago sumagot. Ibaba ang effort setting para sa karaniwang mga hakbang at panatilihin ang matataas na setting para sa pagpaplano o mahihirap na pag-debug.
Bihirang angkop sa mga agent ang diskuwento sa batch at off-peak
Kalahati ang presyo sa mga batch endpoint, pero umaabot nang ilang oras bago maibalik ang mga resulta. Mas angkop ito sa mga evaluation at backfill kaysa sa mga live na agent. Ang off-peak rate ng DeepSeek ang eksepsiyong maaaring gumana para sa mga naka-iskedyul na trabaho.
Mga tanong ng mga gumagawa
Aling modelo ang pinakamura para sa AI agent?
Sa 30-hakbang na coding workload namin, maliliit na modelo ang pinakamura: GPT-6 Luna, Qwen3.7-Flash at GLM-5.3-Flash, na nagkakahalaga ng humigit-kumulang 10 hanggang 20 sentimo bawat task. Hindi ibig sabihin ng murang presyo kada hakbang ay mura rin kada task kung mas maraming hakbang o retry ang kailangan ng modelo. Subukan ang dalawa o tatlong kandidato gamit ang sarili mong mga trace.
Bakit mas mahal nang malaki ang agent ko kaysa sa ipinahihiwatig ng presyo kada token?
Dahil muling ipinapadala sa bawat hakbang ang usapang patuloy na humahaba. Sa 30-hakbang na task na may panimulang prompt na 25K token, mahigit tatlong milyong input token ang naipapadala sa kabuuan. Mas malaki ang matitipid sa prompt caching, mas maiikling output ng tool at pagbubuod ng mga naunang turn kaysa sa pagpapalit ng modelo.
Pinal na ba ang mga presyong ito?
Mga list price ang mga ito sa US dollars mula sa pahina ng presyo ng bawat provider noong 1 October 2026, bago isama ang mga buwis, dagdag-singil sa rehiyon o napagkasunduang diskuwento. Hindi namin nakuha sa sariling pahina ng vendor ang mga presyong may markang third-party.
Ano ang pagkakaiba ng naka-cache na input at mga cache write?
Ang cache read ay ang may diskuwentong presyo para sa mga token na nasa cache na. Naniningil din ang ilang provider, kabilang ang Anthropic, ng dagdag sa unang pagsulat ng prefix sa cache. Ipinapakita ng talahanayan ang mga presyo ng read; nakatala sa pahina ng bawat modelo ang mga presyo ng write kung naaangkop.