Modele i ceny API dla twórców agentów
Agent płaci za każdy wykonany krok, a większość kosztów stanowią dane wejściowe wysłane już wcześniej. Ta tabela zestawia ceny katalogowe, rabaty za cache i limity kontekstu, aby ułatwić wybór modelu na podstawie kosztu całego zadania, a nie ceny nagłówkowej.
Wszystkie modele w jednej tabeli
| Dostawca | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 10 USD* | 1 USD | 50 USD | 1,05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | 10 USD | 0,25 USD | 50 USD | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | 4 USD | 0,20 USD | 20 USD | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | 3 USD | 0,30 USD | 15 USD | 1,05M | 2026-07-16 |
| Command A+cena zewnętrznego dostawcy | Cohere | 2,50 USD | — | 10 USD | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | 2 USD* | 0,10 USD | 10 USD | 1,05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | 2 USD | 0,20 USD | 10 USD | 1M | 2026-09-28 |
| Gemini 3.1 Pro Previewwersja podglądowa | 2 USD* | 0,20 USD | 12 USD | 1,05M | 2026-02-19 | |
| Grok 4.7 | xAI | 2 USD* | 0,50 USD | 6 USD | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | 1,65 USD | 0,21 USD | 4,95 USD | 1M | 2026-08-03 |
| Gemini 3.5 Flash | 1,50 USD | 0,15 USD | 9 USD | 1,05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | 1,50 USD | — | 7,50 USD | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | 1,40 USD | 0,26 USD | 4,40 USD | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | 1,32 USD | 0,044 USD | 3,96 USD | 1M | 2026-08-13 |
| Grok 4.3 | xAI | 1,25 USD* | 0,20 USD | 2,50 USD | 1M | — |
| Muse Spark 1.3 | Meta | 1,25 USD | 0,15 USD | 4,25 USD | 1M | 2026-09-02 |
| Amazon Nova 2 Prowersja podglądowacena zewnętrznego dostawcy | Amazon | 1,25 USD | — | 10 USD | — | — |
| Claude Haiku 4.5 | Anthropic | 1 USD | 0,10 USD | 5 USD | 200K | — |
| Grok Build 0.1 | xAI | 1 USD* | 0,20 USD | 2 USD | 256K | — |
| Gemini 3.8 Flash | 0,75 USD | 0,075 USD | 3,75 USD | 1,05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | 0,30 USD | 0,030 USD | 2,50 USD | 1,05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | 0,30 USD | 0,006 USD | 1,20 USD | 1M | 2026-09-10 |
| Amazon Nova 2 Litecena zewnętrznego dostawcy | Amazon | 0,30 USD | — | 2,50 USD | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | 0,28 USD* | 0,056 USD | 1,10 USD | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | 0,15 USD | — | 0,60 USD | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | 0,15 USD | 0,030 USD | 0,50 USD | 1M | — |
| GPT-6 Luna | OpenAI | 0,10 USD* | 0,010 USD | 0,50 USD | 1,05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | 0,028 USD* | 0,006 USD | 0,11 USD | 1M | 2026-07-15 |
Oblicz koszt własnego scenariusza
Jak czytać te ceny
Najważniejsza jest cena tokenów wejściowych z cache
W pętli agenta prompt systemowy, definicje narzędzi i wcześniejsze tury są wysyłane ponownie przy każdym wywołaniu. Gdy dostawca pobiera ten prefiks z cache, nalicza ułamek standardowej stawki za dane wejściowe — często jedną dziesiątą lub mniej. Dlatego model z tanim cache może być korzystniejszy niż model z niższą ceną nagłówkową.
Długie prompty mogą podnieść koszt całego wywołania
OpenAI, wersja preview Pro od Google, xAI i Qwen naliczają wyższą stawkę, gdy pojedynczy prompt przekroczy próg, na przykład 200K lub 272K tokenów. Wyższa stawka obejmuje wtedy wszystkie tokeny w tym żądaniu. Anthropic obecnie rozlicza całe okno miliona tokenów według standardowej stawki.
Tokeny używane do rozumowania są rozliczane jak tokeny wyjściowe
Modele, które analizują problem przed udzieleniem odpowiedzi, rozliczają ukryte tokeny rozumowania według stawki za dane wyjściowe. Przy rutynowych krokach obniż poziom wysiłku, a wyższe ustawienia zostaw do planowania lub trudnego debugowania.
Rabaty za Batch i godziny poza szczytem rzadko sprawdzają się w agentach
Endpointy Batch obniżają cenę o połowę, ale zwracają wyniki w ciągu kilku godzin, więc lepiej nadają się do ewaluacji i uzupełniania danych niż do agentów działających na żywo. Wyjątkiem jest stawka DeepSeek poza godzinami szczytu, która może sprawdzić się w zaplanowanych zadaniach.
Pytania twórców
Który model jest najtańszy dla agenta AI?
W naszym 30-etapowym scenariuszu programistycznym najtańsze są małe modele: GPT-6 Luna, Qwen3.7-Flash i GLM-5.3-Flash. Koszt każdego z nich wynosi około 10–20 centów za zadanie. Niska cena za krok nie oznacza niskiego kosztu całego zadania, jeśli model potrzebuje więcej kroków lub ponowień. Przetestuj dwóch lub trzech kandydatów na własnych śladach działania.
Dlaczego mój agent kosztuje znacznie więcej, niż wynikałoby z ceny za token?
Ponieważ przy każdym kroku wysyłana jest ponownie coraz dłuższa rozmowa. Zadanie składające się z 30 kroków i rozpoczynające się promptem o długości 25K tokenów wysyła łącznie znacznie ponad trzy miliony tokenów wejściowych. Cache promptów, krótsze wyniki narzędzi i streszczanie wcześniejszych tur pozwalają ograniczyć ten koszt skuteczniej niż zmiana modelu.
Czy te ceny są ostateczne?
To ceny katalogowe w dolarach amerykańskich, podane na stronach z cennikami poszczególnych dostawców 1 października 2026. Nie uwzględniają podatków, dopłat regionalnych ani rabatów negocjowanych. Cen oznaczonych jako pochodzące od zewnętrznego dostawcy nie udało się odczytać z oficjalnej strony sprzedawcy.
Czym różni się odczyt z cache od zapisu do cache?
Odczyt z cache oznacza obniżoną stawkę za tokeny, które już się w nim znajdują. Niektórzy dostawcy, w tym Anthropic, naliczają też wyższą opłatę za pierwsze zapisanie prefiksu do cache. Tabela pokazuje ceny odczytu; ceny zapisu podano na stronie danego modelu, jeśli mają zastosowanie.