Calculadora de costos de agentes
Un agente funciona en un bucle: cada llamada vuelve a enviar todo lo anterior junto con el resultado más reciente de una herramienta. Describe ese bucle una sola vez y consulta cuánto cuesta una tarea y un mes de tareas en cada modelo de nuestra tabla de precios.
| Modelo | Por tarea | 30 días a 50 al día |
|---|---|---|
| GPT-6 Luna | 0,099 US$ | 148 US$ |
| Qwen3.7-Flash28 llamadas con tarifa de prompt largo | 0,101 US$ | 152 US$ |
| GLM-5.3-Flash | 0,182 US$ | 273 US$ |
| DeepSeek-V4.1-Flash | 0,218 US$ | 327 US$ |
| Gemini 3.5 Flash-Lite | 0,333 US$ | 499 US$ |
| Qwen3.7-Plus | 0,343 US$ | 515 US$ |
| Mistral Small 4 | 0,526 US$ | 788 US$ |
| Gemini 3.8 Flash | 0,742 US$ | 1112 US$ |
| DeepSeek-V4-Pro-0813 | 0,961 US$ | 1441 US$ |
| Claude Haiku 4.5 | 0,989 US$ | 1483 US$ |
| Amazon Nova 2 Liteprecio de terceros | 1,10 US$ | 1647 US$ |
| Grok Build 0.1 | 1,16 US$ | 1746 US$ |
| Muse Spark 1.3 | 1,23 US$ | 1852 US$ |
| Grok 4.3 | 1,31 US$ | 1970 US$ |
| Gemini 3.5 Flash | 1,54 US$ | 2306 US$ |
| Qwen3.8-Max | 1,63 US$ | 2443 US$ |
| GLM-5.3 | 1,63 US$ | 2446 US$ |
| GPT-6.1 Sol | 1,69 US$ | 2541 US$ |
| Claude Sonnet 5.5 | 1,98 US$ | 2966 US$ |
| Gemini 3.1 Pro Preview | 2,05 US$ | 3074 US$ |
| Grok 4.7 | 2,68 US$ | 4026 US$ |
| Kimi K3 | 2,97 US$ | 4449 US$ |
| Claude Opus 5.5 | 3,39 US$ | 5082 US$ |
| Amazon Nova 2 Proprecio de terceros | 4,56 US$ | 6840 US$ |
| Mistral Medium 3.5 | 5,31 US$ | 7965 US$ |
| Claude Fable 5.1 | 7,76 US$ | 11.642 US$ |
| Command A+supera la ventana de contextoprecio de terceros | 8,76 US$ | 13.140 US$ |
| GPT-6 Astra | 9,89 US$ | 14.831 US$ |
Cómo funciona la estimación
Para cada llamada del bucle, calculamos el tamaño del prompt —el prompt inicial más el crecimiento acumulado en cada paso anterior— y lo dividimos en una parte almacenada en caché y otra nueva. La primera llamada siempre se considera nueva. Los tokens nuevos se facturan a la tarifa de entrada, los almacenados en caché a la tarifa de caché y los de salida a la tarifa de salida.
Si un prompt supera el umbral de contexto largo del proveedor, la llamada completa se factura a la tarifa de prompt largo, como ocurre con OpenAI, Google, xAI y Qwen. Si el prompt más largo supera la ventana de contexto del modelo, se marca la fila porque un agente real tendría que recortar o resumir primero su historial.
Las tareas varían entre agentes reales, que también reintentan los pasos fallidos y a veces terminan antes. Usa estas cifras para comparar modelos con la misma carga de trabajo y, antes de hacer un presupuesto, mide los recuentos reales de tokens en tus propias trazas.
Preguntas sobre el coste de los agentes
¿Cuántos tokens usa un agente de IA por tarea?
Depende sobre todo del número de pasos y de cuánto añade cada uno. Una conversación breve de soporte puede usar 30K tokens de entrada; una tarea de programación de 30 pasos con un prompt inicial de 25K tokens envía más de tres millones, porque el historial completo se vuelve a enviar en cada llamada.
¿Cómo puedo reducir el coste de un agente?
Mantén idéntico el inicio del prompt entre llamadas para que se almacene en caché, limita los resultados de las herramientas a lo que necesita el modelo, resume o elimina los turnos antiguos, usa un modelo pequeño para los pasos rutinarios y uno grande solo para planificar, y reduce el nivel de razonamiento cuando la calidad lo permita.
¿El almacenamiento en caché de prompts es automático?
Con OpenAI, DeepSeek, Kimi y la caché implícita de Gemini, sí, siempre que los prompts compartan un prefijo largo. Anthropic y algunos endpoints de Qwen requieren marcadores de caché explícitos; además, Anthropic cobra un extra por la primera escritura.
¿Por qué el modelo más barato por token no es el más barato por tarea?
Los descuentos de caché varían según el modelo, algunos proveedores cobran una tarifa más alta por los prompts largos y los modelos de razonamiento consumen tokens de salida mientras piensan. Un modelo que necesita menos pasos o menos reintentos también puede resultar más barato, algo que esta calculadora no puede tener en cuenta.