Model dan harga API untuk pengembang agen
Agen membayar setiap langkah yang diambilnya, dan sebagian besar biaya berasal dari input yang sudah dikirim sebelumnya. Tabel ini menampilkan harga standar, diskon cache, dan batas konteks secara berdampingan agar Anda bisa memilih model berdasarkan biaya keseluruhan suatu tugas, bukan sekadar tarif utama.
Semua model dalam satu tabel
| Penyedia | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | US$10* | US$1 | US$50 | 1,05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | US$10 | US$0,25 | US$50 | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | US$4 | US$0,20 | US$20 | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | US$3 | US$0,30 | US$15 | 1,05M | 2026-07-16 |
| Command A+harga pihak ketiga | Cohere | US$2,50 | — | US$10 | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | US$2* | US$0,10 | US$10 | 1,05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | US$2 | US$0,20 | US$10 | 1M | 2026-09-28 |
| Gemini 3.1 Pro Previewpratinjau | US$2* | US$0,20 | US$12 | 1,05M | 2026-02-19 | |
| Grok 4.7 | xAI | US$2* | US$0,50 | US$6 | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | US$1,65 | US$0,21 | US$4,95 | 1M | 2026-08-03 |
| Gemini 3.5 Flash | US$1,50 | US$0,15 | US$9 | 1,05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | US$1,50 | — | US$7,50 | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | US$1,40 | US$0,26 | US$4,40 | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | US$1,32 | US$0,044 | US$3,96 | 1M | 2026-08-13 |
| Grok 4.3 | xAI | US$1,25* | US$0,20 | US$2,50 | 1M | — |
| Muse Spark 1.3 | Meta | US$1,25 | US$0,15 | US$4,25 | 1M | 2026-09-02 |
| Amazon Nova 2 Propratinjauharga pihak ketiga | Amazon | US$1,25 | — | US$10 | — | — |
| Claude Haiku 4.5 | Anthropic | US$1 | US$0,10 | US$5 | 200K | — |
| Grok Build 0.1 | xAI | US$1* | US$0,20 | US$2 | 256K | — |
| Gemini 3.8 Flash | US$0,75 | US$0,075 | US$3,75 | 1,05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | US$0,30 | US$0,030 | US$2,50 | 1,05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | US$0,30 | US$0,006 | US$1,20 | 1M | 2026-09-10 |
| Amazon Nova 2 Liteharga pihak ketiga | Amazon | US$0,30 | — | US$2,50 | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | US$0,28* | US$0,056 | US$1,10 | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | US$0,15 | — | US$0,60 | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | US$0,15 | US$0,030 | US$0,50 | 1M | — |
| GPT-6 Luna | OpenAI | US$0,10* | US$0,010 | US$0,50 | 1,05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | US$0,028* | US$0,006 | US$0,11 | 1M | 2026-07-15 |
Cara membaca harga ini
Harga input dari cache paling berpengaruh
Dalam loop agen, system prompt, definisi tool, dan giliran percakapan sebelumnya dikirim ulang pada setiap pemanggilan. Provider mengenakan tarif input normal hanya sebagian kecil ketika awalan tersebut diambil dari cache, sering kali sepersepuluh atau bahkan lebih murah. Karena itu, model dengan harga cache rendah bisa lebih murah daripada model dengan harga utama yang lebih rendah.
Prompt panjang bisa mengubah tarif seluruh pemanggilan
OpenAI, pratinjau Pro Google, xAI, dan Qwen mengenakan tarif lebih tinggi saat satu prompt melewati ambang tertentu, seperti 200K atau 272K token. Tarif yang lebih tinggi berlaku untuk setiap token dalam permintaan tersebut. Saat ini, Anthropic mengenakan tarif standar untuk seluruh jendela satu juta token.
Token penalaran dihitung sebagai output
Model yang berpikir sebelum menjawab mengenakan tarif output untuk penalaran tersembunyinya. Turunkan tingkat upaya untuk langkah rutin dan gunakan pengaturan tinggi untuk perencanaan atau debugging yang sulit.
Diskon batch dan di luar jam sibuk jarang cocok untuk agen
Endpoint batch memangkas separuh harga, tetapi hasilnya baru tersedia dalam hitungan jam. Ini cocok untuk evaluasi dan pengisian ulang data, bukan untuk agen aktif. Tarif di luar jam sibuk DeepSeek adalah pengecualian yang bisa digunakan untuk tugas terjadwal.
Pertanyaan umum dari pengembang
Model apa yang paling murah untuk agen AI?
Untuk beban kerja coding kami dengan 30 langkah, model termurah adalah model kecil: GPT-6 Luna, Qwen3.7-Flash, dan GLM-5.3-Flash, masing-masing sekitar 10 hingga 20 sen per tugas. Biaya rendah per langkah belum tentu berarti biaya rendah per tugas jika model membutuhkan lebih banyak langkah atau percobaan ulang. Jadi, uji dua atau tiga kandidat dengan trace Anda sendiri.
Mengapa biaya agen saya jauh lebih tinggi daripada perkiraan berdasarkan harga per token?
Karena setiap langkah mengirim ulang percakapan yang terus bertambah. Tugas dengan 30 langkah dan prompt awal 25K token mengirim total jauh lebih dari tiga juta token input. Caching prompt, mempersingkat output tool, dan merangkum giliran lama lebih efektif untuk mengurangi biaya daripada mengganti model.
Apakah harga ini sudah final?
Ini adalah harga standar dalam dolar AS dari halaman harga masing-masing provider per 1 Oktober 2026, sebelum pajak, biaya tambahan regional, atau diskon hasil negosiasi. Harga yang ditandai sebagai pihak ketiga tidak dapat diverifikasi dari halaman vendor sendiri.
Apa perbedaan antara input dari cache dan penulisan ke cache?
Pembacaan cache adalah tarif diskon untuk token yang sudah ada di cache. Beberapa provider, termasuk Anthropic, juga mengenakan biaya tambahan saat awalan pertama kali ditulis ke cache. Tabel ini menampilkan harga baca; harga tulis dicantumkan di halaman masing-masing model jika berlaku.