Công cụ tính chi phí agent
Agent hoạt động theo vòng lặp: mỗi lần gọi sẽ gửi lại toàn bộ nội dung trước đó cùng kết quả tool mới nhất. Mô tả vòng lặp một lần để xem chi phí cho một tác vụ và một tháng chạy tác vụ trên từng model trong bảng giá của chúng tôi.
| Mô hình | Mỗi tác vụ | 30 ngày, 50 tác vụ mỗi ngày |
|---|---|---|
| GPT-6 Luna | 0,099 US$ | 148 US$ |
| Qwen3.7-Flash28 lượt gọi tính theo mức giá prompt dài | 0,101 US$ | 152 US$ |
| GLM-5.3-Flash | 0,182 US$ | 273 US$ |
| DeepSeek-V4.1-Flash | 0,218 US$ | 327 US$ |
| Gemini 3.5 Flash-Lite | 0,333 US$ | 499 US$ |
| Qwen3.7-Plus | 0,343 US$ | 515 US$ |
| Mistral Small 4 | 0,526 US$ | 788 US$ |
| Gemini 3.8 Flash | 0,742 US$ | 1.112 US$ |
| DeepSeek-V4-Pro-0813 | 0,961 US$ | 1.441 US$ |
| Claude Haiku 4.5 | 0,989 US$ | 1.483 US$ |
| Amazon Nova 2 Litegiá của bên thứ ba | 1,10 US$ | 1.647 US$ |
| Grok Build 0.1 | 1,16 US$ | 1.746 US$ |
| Muse Spark 1.3 | 1,23 US$ | 1.852 US$ |
| Grok 4.3 | 1,31 US$ | 1.970 US$ |
| Gemini 3.5 Flash | 1,54 US$ | 2.306 US$ |
| Qwen3.8-Max | 1,63 US$ | 2.443 US$ |
| GLM-5.3 | 1,63 US$ | 2.446 US$ |
| GPT-6.1 Sol | 1,69 US$ | 2.541 US$ |
| Claude Sonnet 5.5 | 1,98 US$ | 2.966 US$ |
| Gemini 3.1 Pro Preview | 2,05 US$ | 3.074 US$ |
| Grok 4.7 | 2,68 US$ | 4.026 US$ |
| Kimi K3 | 2,97 US$ | 4.449 US$ |
| Claude Opus 5.5 | 3,39 US$ | 5.082 US$ |
| Amazon Nova 2 Progiá của bên thứ ba | 4,56 US$ | 6.840 US$ |
| Mistral Medium 3.5 | 5,31 US$ | 7.965 US$ |
| Claude Fable 5.1 | 7,76 US$ | 11.642 US$ |
| Command A+vượt quá cửa sổ ngữ cảnhgiá của bên thứ ba | 8,76 US$ | 13.140 US$ |
| GPT-6 Astra | 9,89 US$ | 14.831 US$ |
Cách tính ước tính
Với mỗi lượt gọi trong vòng lặp, chúng tôi lấy kích thước prompt — prompt đầu tiên cộng phần tăng thêm từ mỗi bước trước đó — rồi chia thành phần được lấy từ cache và phần mới. Lượt gọi đầu tiên luôn được tính là phần mới. Token mới được tính theo giá đầu vào, token từ cache theo giá cache và token đầu ra theo giá đầu ra.
Nếu một prompt vượt ngưỡng ngữ cảnh dài của nhà cung cấp, toàn bộ lượt gọi đó được tính theo mức giá prompt dài, như cách OpenAI, Google, xAI và Qwen áp dụng. Nếu prompt lớn nhất vượt quá cửa sổ ngữ cảnh của model, dòng đó sẽ được đánh dấu vì agent thực tế cần rút gọn hoặc tóm tắt lịch sử trước.
Agent thực tế có thể xử lý các tác vụ khác nhau, thử lại các bước lỗi và đôi khi dừng sớm. Hãy xem các số liệu này là cách so sánh model trên cùng một khối lượng công việc, sau đó đo số token thực tế từ trace của bạn trước khi lập ngân sách.
Câu hỏi về chi phí agent
AI agent dùng bao nhiêu token cho mỗi tác vụ?
Điều này chủ yếu phụ thuộc vào số bước và lượng nội dung được thêm vào ở mỗi bước. Một cuộc trao đổi hỗ trợ ngắn có thể dùng 30K token đầu vào; một tác vụ lập trình gồm 30 bước với prompt ban đầu 25K token sẽ gửi hơn ba triệu token, vì toàn bộ lịch sử được gửi lại ở mỗi lượt gọi.
Làm cách nào để giảm chi phí của agent?
Giữ nguyên phần đầu của prompt giữa các lượt gọi để nội dung được lưu vào cache, chỉ giữ lại những kết quả công cụ mà model cần, tóm tắt hoặc loại bỏ các lượt trao đổi cũ, dùng model nhỏ cho các bước thường lệ và chỉ dùng model lớn để lập kế hoạch; đồng thời giảm mức độ suy luận khi chất lượng vẫn đáp ứng yêu cầu.
Prompt caching có tự động diễn ra không?
Với OpenAI, DeepSeek, Kimi và cơ chế caching ngầm của Gemini, tính năng này sẽ hoạt động khi các prompt có chung một tiền tố dài. Anthropic và một số endpoint Qwen cần dấu đánh dấu cache rõ ràng; Anthropic còn tính thêm phí cho lần ghi đầu tiên.
Vì sao model có giá mỗi token thấp nhất không phải lúc nào cũng rẻ nhất cho mỗi tác vụ?
Mức giảm giá cho token từ cache khác nhau giữa các model, một số nhà cung cấp tính giá cao hơn cho prompt dài và các model suy luận dùng token đầu ra để suy nghĩ. Model cần ít bước hơn hoặc ít lần thử lại hơn cũng có thể rẻ hơn, điều mà công cụ tính này không thể phản ánh.