dotsagent.io
Idioma:Español
Build · herramienta

Calculadora de costos de agentes

Un agente funciona en un bucle: cada llamada vuelve a enviar todo lo anterior junto con el resultado más reciente de una herramienta. Describe ese bucle una sola vez y consulta cuánto cuesta una tarea y un mes de tareas en cada modelo de nuestra tabla de precios.

Empezar con una carga de trabajo

Lee archivos, modifica código y ejecuta pruebas en un repositorio. Usa un prompt de sistema extenso con esquemas de herramientas, y cada paso añade un archivo o un registro de pruebas.

Cada tarea envía 3.360.000 tokens de entrada y recibe 36.000 tokens de salida. El prompt individual más largo tiene 199.000 tokens.

Coste estimado por tarea y al mes para cada modelo
ModeloPor tarea30 días a 50 al día
GPT-6 Luna · OpenAI⁨0,099 US$⁩⁨148 US$⁩
Qwen3.7-Flash · Alibaba Cloud (Qwen)28 llamadas con tarifa de prompt largo⁨0,101 US$⁩⁨152 US$⁩
GLM-5.3-Flash · Z.ai (Zhipu)⁨0,182 US$⁩⁨273 US$⁩
DeepSeek-V4.1-Flash · DeepSeek⁨0,218 US$⁩⁨327 US$⁩
Gemini 3.5 Flash-Lite · Google⁨0,333 US$⁩⁨499 US$⁩
Qwen3.7-Plus · Alibaba Cloud (Qwen)⁨0,343 US$⁩⁨515 US$⁩
Mistral Small 4 · Mistral AI⁨0,526 US$⁩⁨788 US$⁩
Gemini 3.8 Flash · Google⁨0,742 US$⁩⁨1112 US$⁩
DeepSeek-V4-Pro-0813 · DeepSeek⁨0,961 US$⁩⁨1441 US$⁩
Claude Haiku 4.5 · Anthropic⁨0,989 US$⁩⁨1483 US$⁩
Amazon Nova 2 Lite · Amazonprecio de terceros⁨1,10 US$⁩⁨1647 US$⁩
Grok Build 0.1 · xAI⁨1,16 US$⁩⁨1746 US$⁩
Muse Spark 1.3 · Meta⁨1,23 US$⁩⁨1852 US$⁩
Grok 4.3 · xAI⁨1,31 US$⁩⁨1970 US$⁩
Gemini 3.5 Flash · Google⁨1,54 US$⁩⁨2306 US$⁩
Qwen3.8-Max · Alibaba Cloud (Qwen)⁨1,63 US$⁩⁨2443 US$⁩
GLM-5.3 · Z.ai (Zhipu)⁨1,63 US$⁩⁨2446 US$⁩
GPT-6.1 Sol · OpenAI⁨1,69 US$⁩⁨2541 US$⁩
Claude Sonnet 5.5 · Anthropic⁨1,98 US$⁩⁨2966 US$⁩
Gemini 3.1 Pro Preview · Google⁨2,05 US$⁩⁨3074 US$⁩
Grok 4.7 · xAI⁨2,68 US$⁩⁨4026 US$⁩
Kimi K3 · Moonshot AI (Kimi)⁨2,97 US$⁩⁨4449 US$⁩
Claude Opus 5.5 · Anthropic⁨3,39 US$⁩⁨5082 US$⁩
Amazon Nova 2 Pro · Amazonprecio de terceros⁨4,56 US$⁩⁨6840 US$⁩
Mistral Medium 3.5 · Mistral AI⁨5,31 US$⁩⁨7965 US$⁩
Claude Fable 5.1 · Anthropic⁨7,76 US$⁩⁨11.642 US$⁩
Command A+ · Coheresupera la ventana de contextoprecio de terceros⁨8,76 US$⁩⁨13.140 US$⁩
GPT-6 Astra · OpenAI⁨9,89 US$⁩⁨14.831 US$⁩

Precios de lista, tarifa estándar, en dólares estadounidenses. No se incluyen las escrituras en caché, los impuestos, las tarifas de herramientas como la búsqueda web ni los recargos regionales.

Cómo funciona la estimación

Para cada llamada del bucle, calculamos el tamaño del prompt —el prompt inicial más el crecimiento acumulado en cada paso anterior— y lo dividimos en una parte almacenada en caché y otra nueva. La primera llamada siempre se considera nueva. Los tokens nuevos se facturan a la tarifa de entrada, los almacenados en caché a la tarifa de caché y los de salida a la tarifa de salida.

Si un prompt supera el umbral de contexto largo del proveedor, la llamada completa se factura a la tarifa de prompt largo, como ocurre con OpenAI, Google, xAI y Qwen. Si el prompt más largo supera la ventana de contexto del modelo, se marca la fila porque un agente real tendría que recortar o resumir primero su historial.

Las tareas varían entre agentes reales, que también reintentan los pasos fallidos y a veces terminan antes. Usa estas cifras para comparar modelos con la misma carga de trabajo y, antes de hacer un presupuesto, mide los recuentos reales de tokens en tus propias trazas.

Preguntas sobre el coste de los agentes

¿Cuántos tokens usa un agente de IA por tarea?

Depende sobre todo del número de pasos y de cuánto añade cada uno. Una conversación breve de soporte puede usar 30K tokens de entrada; una tarea de programación de 30 pasos con un prompt inicial de 25K tokens envía más de tres millones, porque el historial completo se vuelve a enviar en cada llamada.

¿Cómo puedo reducir el coste de un agente?

Mantén idéntico el inicio del prompt entre llamadas para que se almacene en caché, limita los resultados de las herramientas a lo que necesita el modelo, resume o elimina los turnos antiguos, usa un modelo pequeño para los pasos rutinarios y uno grande solo para planificar, y reduce el nivel de razonamiento cuando la calidad lo permita.

¿El almacenamiento en caché de prompts es automático?

Con OpenAI, DeepSeek, Kimi y la caché implícita de Gemini, sí, siempre que los prompts compartan un prefijo largo. Anthropic y algunos endpoints de Qwen requieren marcadores de caché explícitos; además, Anthropic cobra un extra por la primera escritura.

¿Por qué el modelo más barato por token no es el más barato por tarea?

Los descuentos de caché varían según el modelo, algunos proveedores cobran una tarifa más alta por los prompts largos y los modelos de razonamiento consumen tokens de salida mientras piensan. Un modelo que necesita menos pasos o menos reintentos también puede resultar más barato, algo que esta calculadora no puede tener en cuenta.