Модели и цены API для разработчиков агентов
Агент платит за каждый свой шаг, и большую часть расходов составляют данные, которые он уже отправлял. В этой таблице рядом указаны цены, скидки на кэширование и ограничения контекста: выбирайте модель по стоимости всей задачи, а не по заявленной цене.
Все модели в одной таблице
| Провайдер | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 10 $* | 1 $ | 50 $ | 1,05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | 10 $ | 0,25 $ | 50 $ | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | 4 $ | 0,20 $ | 20 $ | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | 3 $ | 0,30 $ | 15 $ | 1,05M | 2026-07-16 |
| Command A+цена стороннего провайдера | Cohere | 2,50 $ | — | 10 $ | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | 2 $* | 0,10 $ | 10 $ | 1,05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | 2 $ | 0,20 $ | 10 $ | 1M | 2026-09-28 |
| Gemini 3.1 Pro Previewпредварительная версия | 2 $* | 0,20 $ | 12 $ | 1,05M | 2026-02-19 | |
| Grok 4.7 | xAI | 2 $* | 0,50 $ | 6 $ | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | 1,65 $ | 0,21 $ | 4,95 $ | 1M | 2026-08-03 |
| Gemini 3.5 Flash | 1,50 $ | 0,15 $ | 9 $ | 1,05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | 1,50 $ | — | 7,50 $ | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | 1,40 $ | 0,26 $ | 4,40 $ | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | 1,32 $ | 0,044 $ | 3,96 $ | 1M | 2026-08-13 |
| Grok 4.3 | xAI | 1,25 $* | 0,20 $ | 2,50 $ | 1M | — |
| Muse Spark 1.3 | Meta | 1,25 $ | 0,15 $ | 4,25 $ | 1M | 2026-09-02 |
| Amazon Nova 2 Proпредварительная версияцена стороннего провайдера | Amazon | 1,25 $ | — | 10 $ | — | — |
| Claude Haiku 4.5 | Anthropic | 1 $ | 0,10 $ | 5 $ | 200K | — |
| Grok Build 0.1 | xAI | 1 $* | 0,20 $ | 2 $ | 256K | — |
| Gemini 3.8 Flash | 0,75 $ | 0,075 $ | 3,75 $ | 1,05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | 0,30 $ | 0,030 $ | 2,50 $ | 1,05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | 0,30 $ | 0,006 $ | 1,20 $ | 1M | 2026-09-10 |
| Amazon Nova 2 Liteцена стороннего провайдера | Amazon | 0,30 $ | — | 2,50 $ | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | 0,28 $* | 0,056 $ | 1,10 $ | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | 0,15 $ | — | 0,60 $ | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | 0,15 $ | 0,030 $ | 0,50 $ | 1M | — |
| GPT-6 Luna | OpenAI | 0,10 $* | 0,010 $ | 0,50 $ | 1,05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | 0,028 $* | 0,006 $ | 0,11 $ | 1M | 2026-07-15 |
Рассчитайте стоимость своей нагрузки
Как читать эти цены
Цена кэшированного ввода важнее всего
В цикле агента системный промпт, описания инструментов и предыдущие реплики отправляются заново при каждом вызове. Если этот префикс берётся из кэша, провайдеры взимают лишь часть обычной цены на ввод — часто десятую долю или меньше. Поэтому модель с дешёвым кэшированием может оказаться выгоднее модели с более низкой заявленной ценой.
Длинные промпты могут повысить цену всего вызова
OpenAI, предварительная версия Pro от Google, xAI и Qwen повышают тариф, если один промпт превышает определённый порог, например 200K или 272K токенов. Повышенный тариф применяется ко всем токенам в этом запросе. Anthropic пока тарифицирует всё окно в миллион токенов по стандартному тарифу.
Токены рассуждений тарифицируются как выходные
Модели, которые рассуждают перед ответом, тарифицируют скрытые рассуждения по цене выходных токенов. Для обычных шагов снижайте уровень усилий, а высокие настройки оставляйте для планирования и сложной отладки.
Скидки на пакетную обработку и внепиковое использование редко подходят агентам
Пакетные endpoint вдвое снижают цену, но результаты приходят в течение нескольких часов. Это подходит для оценки моделей и обработки накопленных данных, но не для работающих в реальном времени агентов. Исключение — тариф DeepSeek вне пиковых часов: он может подойти для запланированных задач.
Частые вопросы разработчиков
Какая модель дешевле всего для AI-агента?
В нашей задаче по программированию из 30 шагов дешевле всего небольшие модели: GPT-6 Luna, Qwen3.7-Flash и GLM-5.3-Flash — примерно от 10 до 20 центов за задачу каждая. Низкая цена за шаг не означает низкую цену за задачу, если модели требуется больше шагов или повторных попыток. Проверьте двух-трёх кандидатов на собственных трассировках.
Почему мой агент обходится намного дороже, чем можно ожидать по цене за токен?
Потому что на каждом шаге повторно отправляется растущая история диалога. За задачу из 30 шагов с начальным промптом на 25K токенов в сумме отправляется значительно больше трёх миллионов входных токенов. Кэширование промптов, сокращение ответов инструментов и сводки предыдущих реплик помогают сильнее, чем смена модели.
Это окончательные цены?
Это опубликованные цены в долларах США с тарифных страниц провайдеров по состоянию на 1 октября 2026 года, без учёта налогов, региональных надбавок и индивидуальных скидок. Для цен, отмеченных как данные третьих сторон, не удалось найти подтверждение на сайте самого поставщика.
Чем кэшированное чтение отличается от записи в кэш?
Кэшированное чтение — это сниженный тариф на токены, уже находящиеся в кэше. Некоторые провайдеры, включая Anthropic, также взимают надбавку при первой записи префикса в кэш. В таблице указаны цены на чтение; цены на запись приводятся на странице каждой модели, если они применяются.