Kalkulator biaya agent
Agent bekerja dalam loop: setiap panggilan mengirim ulang semua konteks sejauh ini beserta hasil tool terbaru. Jelaskan loop tersebut sekali, lalu lihat biaya satu tugas dan tugas selama sebulan pada setiap model di tabel harga kami.
| Model | Per tugas | 30 hari dengan 50 tugas per hari |
|---|---|---|
| GPT-6 Luna | US$0,099 | US$148 |
| Qwen3.7-Flash28 panggilan dengan tarif prompt panjang | US$0,101 | US$152 |
| GLM-5.3-Flash | US$0,182 | US$273 |
| DeepSeek-V4.1-Flash | US$0,218 | US$327 |
| Gemini 3.5 Flash-Lite | US$0,333 | US$499 |
| Qwen3.7-Plus | US$0,343 | US$515 |
| Mistral Small 4 | US$0,526 | US$788 |
| Gemini 3.8 Flash | US$0,742 | US$1.112 |
| DeepSeek-V4-Pro-0813 | US$0,961 | US$1.441 |
| Claude Haiku 4.5 | US$0,989 | US$1.483 |
| Amazon Nova 2 Liteharga pihak ketiga | US$1,10 | US$1.647 |
| Grok Build 0.1 | US$1,16 | US$1.746 |
| Muse Spark 1.3 | US$1,23 | US$1.852 |
| Grok 4.3 | US$1,31 | US$1.970 |
| Gemini 3.5 Flash | US$1,54 | US$2.306 |
| Qwen3.8-Max | US$1,63 | US$2.443 |
| GLM-5.3 | US$1,63 | US$2.446 |
| GPT-6.1 Sol | US$1,69 | US$2.541 |
| Claude Sonnet 5.5 | US$1,98 | US$2.966 |
| Gemini 3.1 Pro Preview | US$2,05 | US$3.074 |
| Grok 4.7 | US$2,68 | US$4.026 |
| Kimi K3 | US$2,97 | US$4.449 |
| Claude Opus 5.5 | US$3,39 | US$5.082 |
| Amazon Nova 2 Proharga pihak ketiga | US$4,56 | US$6.840 |
| Mistral Medium 3.5 | US$5,31 | US$7.965 |
| Claude Fable 5.1 | US$7,76 | US$11.642 |
| Command A+melebihi jendela konteksharga pihak ketiga | US$8,76 | US$13.140 |
| GPT-6 Astra | US$9,89 | US$14.831 |
Cara kerja perkiraan
Untuk setiap panggilan dalam loop, kami menghitung ukuran prompt—prompt pertama ditambah pertumbuhan dari setiap langkah sebelumnya—lalu membaginya menjadi porsi yang di-cache dan porsi baru. Panggilan pertama selalu dihitung sebagai porsi baru. Token baru dikenai tarif input, token yang di-cache dikenai tarif cache, dan output dikenai tarif output.
Jika satu prompt melewati ambang batas konteks panjang provider, seluruh panggilan tersebut dikenai tarif prompt panjang, seperti yang diterapkan OpenAI, Google, xAI, dan Qwen. Jika prompt terbesar melebihi jendela konteks model, baris tersebut akan ditandai karena agent sungguhan perlu memangkas atau merangkum riwayatnya terlebih dahulu.
Tugas yang dikerjakan agent sungguhan bisa berbeda-beda, langkah yang gagal dapat dicoba ulang, dan terkadang agent berhenti lebih awal. Gunakan angka ini untuk membandingkan model pada beban kerja yang sama, lalu ukur jumlah token aktual dari trace Anda sendiri sebelum menyusun anggaran.
Pertanyaan tentang biaya agent
Berapa banyak token yang digunakan AI agent untuk setiap tugas?
Faktor utamanya adalah jumlah langkah dan banyaknya konten yang ditambahkan pada setiap langkah. Percakapan singkat dengan dukungan mungkin menggunakan 30K token input; tugas coding 30 langkah dengan prompt awal 25K token mengirim lebih dari tiga juta token karena seluruh riwayat dikirim ulang pada setiap panggilan.
Bagaimana cara menurunkan biaya agent?
Pertahankan bagian awal prompt agar tetap sama di setiap panggilan supaya dapat di-cache, pangkas hasil tool sesuai kebutuhan model, rangkum atau hapus giliran lama, gunakan model kecil untuk langkah rutin dan model besar hanya untuk perencanaan, serta kurangi upaya penalaran jika kualitas tetap memadai.
Apakah prompt caching terjadi secara otomatis?
Untuk OpenAI, DeepSeek, Kimi, dan implicit caching Gemini, caching terjadi jika prompt memiliki prefiks panjang yang sama. Endpoint Anthropic dan beberapa endpoint Qwen memerlukan penanda cache eksplisit, dan Anthropic mengenakan biaya tambahan untuk penulisan cache pertama.
Mengapa model dengan harga per token termurah bukan yang termurah per tugas?
Diskon cache berbeda-beda antar model, beberapa provider mengenakan tarif lebih tinggi untuk prompt panjang, dan model penalaran menggunakan token output untuk berpikir. Model yang membutuhkan lebih sedikit langkah atau percobaan ulang juga bisa lebih murah, tetapi hal ini tidak dapat diperhitungkan oleh kalkulator ini.