에이전트 비용 계산기
에이전트는 반복 실행되는 루프입니다. 호출할 때마다 지금까지의 전체 내용과 최신 도구 결과를 다시 전송합니다. 이 루프를 한 번 설명하면 가격표에 있는 모든 모델에서 작업 1회와 한 달간의 작업 비용을 확인할 수 있습니다.
| 모델 | 작업당 | 하루 50회, 30일 기준 |
|---|---|---|
| GPT-6 Luna | US$0.099 | US$148 |
| Qwen3.7-Flash장문 프롬프트 요금이 적용되는 호출 28회 | US$0.101 | US$152 |
| GLM-5.3-Flash | US$0.182 | US$273 |
| DeepSeek-V4.1-Flash | US$0.218 | US$327 |
| Gemini 3.5 Flash-Lite | US$0.333 | US$499 |
| Qwen3.7-Plus | US$0.343 | US$515 |
| Mistral Small 4 | US$0.526 | US$788 |
| Gemini 3.8 Flash | US$0.742 | US$1,112 |
| DeepSeek-V4-Pro-0813 | US$0.961 | US$1,441 |
| Claude Haiku 4.5 | US$0.989 | US$1,483 |
| Amazon Nova 2 Lite타사 가격 | US$1.10 | US$1,647 |
| Grok Build 0.1 | US$1.16 | US$1,746 |
| Muse Spark 1.3 | US$1.23 | US$1,852 |
| Grok 4.3 | US$1.31 | US$1,970 |
| Gemini 3.5 Flash | US$1.54 | US$2,306 |
| Qwen3.8-Max | US$1.63 | US$2,443 |
| GLM-5.3 | US$1.63 | US$2,446 |
| GPT-6.1 Sol | US$1.69 | US$2,541 |
| Claude Sonnet 5.5 | US$1.98 | US$2,966 |
| Gemini 3.1 Pro Preview | US$2.05 | US$3,074 |
| Grok 4.7 | US$2.68 | US$4,026 |
| Kimi K3 | US$2.97 | US$4,449 |
| Claude Opus 5.5 | US$3.39 | US$5,082 |
| Amazon Nova 2 Pro타사 가격 | US$4.56 | US$6,840 |
| Mistral Medium 3.5 | US$5.31 | US$7,965 |
| Claude Fable 5.1 | US$7.76 | US$11,642 |
| Command A+컨텍스트 윈도우 초과타사 가격 | US$8.76 | US$13,140 |
| GPT-6 Astra | US$9.89 | US$14,831 |
예상 비용 계산 방식
루프의 각 호출에서 프롬프트 크기를 계산합니다. 첫 프롬프트에 이전 단계에서 추가된 내용을 모두 더한 뒤, 캐시된 부분과 새로 입력되는 부분으로 나눕니다. 첫 호출은 항상 새 입력으로 처리합니다. 새 토큰에는 입력 요금, 캐시된 토큰에는 캐시 요금, 출력 토큰에는 출력 요금이 적용됩니다.
단일 프롬프트가 provider의 장문 컨텍스트 기준을 넘으면 해당 호출 전체에 장문 프롬프트 요금이 적용됩니다. OpenAI, Google, xAI, Qwen이 이 방식을 사용합니다. 가장 큰 프롬프트가 모델의 컨텍스트 윈도우보다 크면 해당 행에 표시합니다. 실제 에이전트는 먼저 대화 기록을 줄이거나 요약해야 합니다.
실제 에이전트의 작업마다 사용량은 다르며, 실패한 단계를 다시 시도하거나 일찍 멈추기도 합니다. 이 수치는 동일한 작업 기준으로 모델을 비교하는 데 활용하세요. 예산을 세우기 전에는 자체 trace에서 실제 토큰 수를 측정하세요.
에이전트 비용 관련 질문
AI 에이전트는 작업당 토큰을 얼마나 사용하나요?
주로 단계 수와 단계마다 추가되는 내용의 양에 따라 달라집니다. 짧은 고객 지원 대화에는 입력 토큰 30K개가 사용될 수 있습니다. 시작 프롬프트가 25K 토큰인 30단계 코딩 작업은 호출할 때마다 전체 기록을 다시 보내므로 입력 토큰이 300만 개를 넘을 수 있습니다.
에이전트 비용을 줄이려면 어떻게 해야 하나요?
호출 간 프롬프트의 앞부분을 동일하게 유지해 캐시를 활용하고, 도구 결과는 모델에 필요한 내용만 남기세요. 오래된 대화는 요약하거나 제거하고, 일상적인 단계에는 작은 모델을, 계획 수립에만 큰 모델을 사용하세요. 품질이 허용하는 범위에서 추론 강도도 낮추세요.
프롬프트 캐싱은 자동으로 되나요?
OpenAI, DeepSeek, Kimi와 Gemini의 암시적 캐싱은 프롬프트의 긴 접두부가 일치하면 자동으로 적용됩니다. Anthropic 및 일부 Qwen endpoint는 명시적인 캐시 표시가 필요하며, Anthropic은 첫 캐시 쓰기에 추가 요금을 부과합니다.
토큰당 가장 저렴한 모델이 작업당으로는 가장 저렴하지 않은 이유가 뭔가요?
캐시 할인은 모델마다 다르고, 일부 provider는 장문 프롬프트에 더 높은 요금을 부과하며, 추론 모델은 생각하는 데 출력 토큰을 사용합니다. 단계나 재시도 횟수가 더 적은 모델이 전체 비용 면에서 유리할 수도 있지만, 이 계산기로는 그런 차이를 반영할 수 없습니다.