โมเดลและราคา API สำหรับผู้สร้าง agent
agent ต้องจ่ายสำหรับทุกขั้นตอนที่ทำ และค่าใช้จ่ายส่วนใหญ่คือ input ที่ส่งไปแล้ว ตารางนี้แสดงราคาเต็ม ส่วนลดจาก cache และขีดจำกัด context ไว้เทียบกัน เพื่อให้คุณเลือกโมเดลจากต้นทุนของงานทั้งชิ้น ไม่ใช่ดูแค่ราคาที่พาดหัว
ทุกรุ่นในตารางเดียว
| ผู้ให้บริการ | ||||||
|---|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | US$10* | US$1 | US$50 | 1.05M | 2026-09-08 |
| Claude Fable 5.1 | Anthropic | US$10 | US$0.25 | US$50 | 1M | 2026-09-01 |
| Claude Opus 5.5 | Anthropic | US$4 | US$0.20 | US$20 | 1M | 2026-09-22 |
| Kimi K3 | Moonshot AI (Kimi) | US$3 | US$0.30 | US$15 | 1.05M | 2026-07-16 |
| Command A+ราคาจากบุคคลที่สาม | Cohere | US$2.50 | — | US$10 | 128K | 2026-05-20 |
| GPT-6.1 Sol | OpenAI | US$2* | US$0.10 | US$10 | 1.05M | 2026-09-29 |
| Claude Sonnet 5.5 | Anthropic | US$2 | US$0.20 | US$10 | 1M | 2026-09-28 |
| Gemini 3.1 Pro Previewพรีวิว | US$2* | US$0.20 | US$12 | 1.05M | 2026-02-19 | |
| Grok 4.7 | xAI | US$2* | US$0.50 | US$6 | 500K | 2026-09-21 |
| Qwen3.8-Max | Alibaba Cloud (Qwen) | US$1.65 | US$0.21 | US$4.95 | 1M | 2026-08-03 |
| Gemini 3.5 Flash | US$1.50 | US$0.15 | US$9 | 1.05M | 2026-05-19 | |
| Mistral Medium 3.5 | Mistral AI | US$1.50 | — | US$7.50 | 256K | 2026-04-28 |
| GLM-5.3 | Z.ai (Zhipu) | US$1.40 | US$0.26 | US$4.40 | 1M | 2026-08-14 |
| DeepSeek-V4-Pro-0813 | DeepSeek | US$1.32 | US$0.044 | US$3.96 | 1M | 2026-08-13 |
| Grok 4.3 | xAI | US$1.25* | US$0.20 | US$2.50 | 1M | — |
| Muse Spark 1.3 | Meta | US$1.25 | US$0.15 | US$4.25 | 1M | 2026-09-02 |
| Amazon Nova 2 Proพรีวิวราคาจากบุคคลที่สาม | Amazon | US$1.25 | — | US$10 | — | — |
| Claude Haiku 4.5 | Anthropic | US$1 | US$0.10 | US$5 | 200K | — |
| Grok Build 0.1 | xAI | US$1* | US$0.20 | US$2 | 256K | — |
| Gemini 3.8 Flash | US$0.75 | US$0.075 | US$3.75 | 1.05M | 2026-09-02 | |
| Gemini 3.5 Flash-Lite | US$0.30 | US$0.030 | US$2.50 | 1.05M | 2026-07-21 | |
| DeepSeek-V4.1-Flash | DeepSeek | US$0.30 | US$0.006 | US$1.20 | 1M | 2026-09-10 |
| Amazon Nova 2 Liteราคาจากบุคคลที่สาม | Amazon | US$0.30 | — | US$2.50 | 1M | 2025-12-02 |
| Qwen3.7-Plus | Alibaba Cloud (Qwen) | US$0.28* | US$0.056 | US$1.10 | 1M | 2026-05-26 |
| Mistral Small 4 | Mistral AI | US$0.15 | — | US$0.60 | 256K | 2026-03-16 |
| GLM-5.3-Flash | Z.ai (Zhipu) | US$0.15 | US$0.030 | US$0.50 | 1M | — |
| GPT-6 Luna | OpenAI | US$0.10* | US$0.010 | US$0.50 | 1.05M | 2026-09-22 |
| Qwen3.7-Flash | Alibaba Cloud (Qwen) | US$0.028* | US$0.006 | US$0.11 | 1M | 2026-07-15 |
วิธีอ่านราคาเหล่านี้
ราคา cached input คือตัวเลขที่ควรดู
ใน agent loop ระบบจะส่ง system prompt, คำจำกัดความของ tool และข้อความก่อนหน้าซ้ำทุกครั้งที่เรียกใช้ ผู้ให้บริการคิดราคาเพียงเศษส่วนของอัตรา input ปกติเมื่อดึง prefix นั้นจาก cache ซึ่งมักเหลือหนึ่งในสิบหรือน้อยกว่า ดังนั้นโมเดลที่มีราคา cache ถูกอาจคุ้มกว่าโมเดลที่มีราคาพาดหัวถูกกว่า
prompt ยาวอาจทำให้ราคาเรียกใช้ทั้งหมดสูงขึ้น
OpenAI, Pro preview ของ Google, xAI และ Qwen คิดอัตราสูงขึ้นเมื่อ prompt ครั้งเดียวเกินเกณฑ์ เช่น 200K หรือ 272K โทเค็น โดยใช้อัตราที่สูงขึ้นกับทุกโทเค็นใน request นั้น ขณะนี้ Anthropic คิดราคา context window เต็มหนึ่งล้านโทเค็นในอัตรามาตรฐาน
โทเค็นสำหรับ reasoning คิดราคาเป็น output
โมเดลที่คิดก่อนตอบจะคิดราคา reasoning ที่ซ่อนไว้ในอัตรา output ลดระดับ effort สำหรับขั้นตอนทั่วไป และเก็บการตั้งค่าระดับสูงไว้ใช้กับการวางแผนหรือการดีบักที่ยาก
ส่วนลด Batch และช่วงนอกเวลาพีกมักไม่เหมาะกับ agent
Batch endpoint ลดราคาได้ครึ่งหนึ่ง แต่ใช้เวลาหลายชั่วโมงกว่าจะได้ผลลัพธ์ จึงเหมาะกับการประเมินผลและการประมวลผลข้อมูลย้อนหลังมากกว่า agent ที่ทำงานแบบเรียลไทม์ อัตรานอกเวลาพีกของ DeepSeek เป็นข้อยกเว้นที่ใช้กับงานตามกำหนดเวลาได้
คำถามที่ผู้สร้าง agent มักถาม
โมเดลไหนถูกที่สุดสำหรับ AI agent?
สำหรับ workload เขียนโค้ด 30 ขั้นตอนของเรา โมเดลที่ถูกที่สุดคือโมเดลขนาดเล็ก ได้แก่ GPT-6 Luna, Qwen3.7-Flash และ GLM-5.3-Flash โดยมีค่าใช้จ่ายงานละประมาณ 10 ถึง 20 เซนต์ ราคาต่อขั้นตอนที่ถูกไม่ได้แปลว่าราคาต่องานจะถูก หากโมเดลต้องทำขั้นตอนหรือ retry มากขึ้น ลองทดสอบตัวเลือกสองหรือสามโมเดลกับ trace ของคุณเอง
ทำไม agent ของฉันถึงมีค่าใช้จ่ายสูงกว่าที่ราคาต่อโทเค็นบอกไว้มาก?
เพราะทุกขั้นตอนจะส่งบทสนทนาที่ขยายขึ้นเรื่อย ๆ ซ้ำอีกครั้ง งาน 30 ขั้นตอนที่เริ่มด้วย prompt 25K โทเค็นจะส่ง input รวมมากกว่าสามล้านโทเค็น การใช้ prompt caching ลด output ของ tool และสรุปข้อความเก่า ช่วยลดค่าใช้จ่ายได้มากกว่าการเปลี่ยนโมเดล
ราคานี้เป็นราคาสุดท้ายหรือไม่?
ราคาเหล่านี้เป็นราคาขายปลีกหน่วยดอลลาร์สหรัฐจากหน้าราคาของผู้ให้บริการแต่ละราย ณ 1 October 2026 ยังไม่รวมภาษี ค่าธรรมเนียมเพิ่มเติมตามภูมิภาค หรือส่วนลดที่ต่อรองได้ ราคาที่ระบุว่าเป็นข้อมูลจากบุคคลที่สามคือราคาที่ตรวจสอบจากหน้าเว็บของผู้ขายเองไม่ได้
cached input กับการเขียน cache ต่างกันอย่างไร?
การอ่าน cache คืออัตราส่วนลดสำหรับโทเค็นที่อยู่ใน cache แล้ว ผู้ให้บริการบางราย รวมถึง Anthropic ยังคิดค่าบริการเพิ่มในครั้งแรกที่เขียน prefix ลง cache ตารางนี้แสดงราคาอ่าน cache ส่วนราคาเขียน cache จะระบุไว้ในหน้าโมเดลแต่ละรุ่นเมื่อมีการคิดราคา