dotsagent.io
ภาษา:ไทย
crawler และ agent 40 ราย

ไดเรกทอรี AI crawler และ agent

รวม AI bot ทุกรายที่เรายืนยันได้ พร้อม token สำหรับใช้ใน robots.txt วัตถุประสงค์ในการดึงข้อมูล คำยืนยันจากผู้ให้บริการว่า bot ปฏิบัติตามกฎหรือไม่ และวิธีตรวจสอบว่าคำขอมาจาก bot นั้นจริงหรือไม่ สำหรับ token ที่พบเฉพาะในทะเบียน ai.robots.txt ของชุมชน จะมีการระบุไว้ในหน้าเฉพาะของแต่ละรายการ

BotTokenวัตถุประสงค์ปฏิบัติตาม robots.txtตรวจสอบ
GPTBot
OpenAI
GPTBotการฝึกโมเดลใช่รายการ IP
OAI-SearchBot
OpenAI
OAI-SearchBotการค้นหาใช่รายการ IP
ChatGPT-User
OpenAI
ChatGPT-Userการดึงข้อมูลโดยผู้ใช้ไม่รายการ IP
OAI-AdsBot
OpenAI
OAI-AdsBotโฆษณาไม่ได้ระบุรายการ IP
ChatGPT agent
OpenAI
ไม่มี tokenAgentsไม่ได้ระบุคำขอที่ลงลายเซ็น
ClaudeBot
Anthropic
ClaudeBotการฝึกโมเดลใช่รายการ IP
Claude-SearchBot
Anthropic
Claude-SearchBotการค้นหาใช่รายการ IP
Claude-User
Anthropic
Claude-Userการดึงข้อมูลโดยผู้ใช้ใช่รายการ IP
Googlebot
Google
Googlebotการค้นหาใช่รายการ IP
Google-Extended
Google
Google-Extendedการฝึกโมเดลใช่—
Google-CloudVertexBot
Google
Google-CloudVertexBotการค้นหาใช่รายการ IP
GoogleOther
Google
GoogleOtherการฝึกโมเดลใช่รายการ IP
Google-Agent
Google
Google-AgentAgentsไม่รายการ IP
Google-GeminiNotebook
Google
Google-GeminiNotebookการดึงข้อมูลโดยผู้ใช้ไม่รายการ IP
Gemini Spark
Google
ไม่มี tokenAgentsไม่ได้ระบุ—
Gemini-Deep-Research
Google
Gemini-Deep-Researchการดึงข้อมูลโดยผู้ใช้ไม่ได้ระบุ—
GoogleAgent-Mariner
Google
GoogleAgent-MarinerAgentsไม่ได้ระบุ—
Applebot
Apple
Applebotการค้นหาใช่รายการ IP
Applebot-Extended
Apple
Applebot-Extendedการฝึกโมเดลใช่—
PerplexityBot
Perplexity
PerplexityBotการค้นหาใช่รายการ IP
Perplexity-User
Perplexity
Perplexity-Userการดึงข้อมูลโดยผู้ใช้ไม่รายการ IP
meta-externalagent
Meta
meta-externalagentการฝึกโมเดลใช่—
meta-webindexer
Meta
meta-webindexerการค้นหาใช่—
meta-externalfetcher
Meta
meta-externalfetcherการดึงข้อมูลโดยผู้ใช้ไม่—
meta-externalads
Meta
meta-externaladsโฆษณาใช่—
facebookexternalhit
Meta
facebookexternalhitการดึงข้อมูลโดยผู้ใช้ไม่—
Muse
Meta
ไม่มี tokenAgentsไม่ได้ระบุ—
Amazonbot
Amazon
Amazonbotการฝึกโมเดลใช่รายการ IP
Amzn-SearchBot
Amazon
Amzn-SearchBotการค้นหาใช่รายการ IP
Amzn-User
Amazon
Amzn-Userการดึงข้อมูลโดยผู้ใช้ไม่รายการ IP
DuckAssistBot
DuckDuckGo
DuckAssistBotการค้นหาใช่รายการ IP
MistralAI-User
Mistral
MistralAI-Userการดึงข้อมูลโดยผู้ใช้ใช่รายการ IP
MistralAI-Index
Mistral
MistralAI-Indexการค้นหาใช่รายการ IP
MistralAI-Training
Mistral
MistralAI-Trainingการฝึกโมเดลใช่—
CCBot
Common Crawl
CCBotการฝึกโมเดลใช่รายการ IP
cohere-ai
Cohere
cohere-aiการดึงข้อมูลโดยผู้ใช้ไม่ได้ระบุ—
Bytespider
ByteDance
Bytespiderการฝึกโมเดลไม่—
YouBot
You.com
YouBotการค้นหาไม่ได้ระบุ—
Diffbot
Diffbot
Diffbotการค้นหาไม่ได้ระบุ—
Timpibot
Timpi
Timpibotการฝึกโมเดลไม่ได้ระบุ—

ความหมายของวัตถุประสงค์

การฝึกโมเดล
รวบรวมหน้าเว็บเพื่อฝึกโมเดลหรือ crawl เพื่อการวิจัยทั่วไป Google-Extended และ Applebot-Extended เป็น control token ที่ไม่ดึงข้อมูลด้วยตัวเอง
การค้นหา
จัดทำดัชนีหน้าเว็บสำหรับผลิตภัณฑ์ค้นหา ตั้งแต่ Google Search ไปจนถึงระบบ AI ที่ตอบคำถาม เช่น ChatGPT search, Perplexity และ DuckAssist การบล็อก bot จะทำให้เว็บไซต์ของคุณไม่ปรากฏในผลิตภัณฑ์นั้น
การดึงข้อมูลโดยผู้ใช้
ดึงหน้าเว็บตามคำขอของผู้ใช้ผ่านแชตหรือเครื่องมือ ผู้ให้บริการหลายรายระบุว่า robots.txt อาจไม่มีผลกับคำขอเหล่านี้
Agents
เปิดดูเว็บและดำเนินการแทนผู้ใช้ โดยมักทำงานผ่านเบราว์เซอร์เต็มรูปแบบ หลายรายไม่มี token และอาจตรวจสอบได้จากลายเซ็นเท่านั้น หากมี
โฆษณา
ตรวจสอบหน้า Landing Page ของโฆษณาที่ผู้ลงโฆษณาส่งมา ไม่รวมรายการเหล่านี้ในตัวสร้าง robots.txt

ตรวจสอบว่าบอตเป็นตัวจริงตามที่อ้างหรือไม่

ปลอมสตริง user-agent ได้โดยไม่มีค่าใช้จ่าย ผู้ให้บริการรายใหญ่ส่วนใหญ่เผยแพร่ช่วง IP ที่บอตใช้เป็นไฟล์ JSON โดยระบุไว้ในตารางว่าเป็นรายการ IP ให้เปรียบเทียบ address ของคำขอกับรายการของ token นั้น และอย่าถือว่าการที่ชื่อเพียงอย่างเดียวตรงกันเป็นการยืนยันตัวตน

ผู้ให้บริการบางรายยังบันทึกข้อมูล reverse DNS ไว้ด้วย ตัวอย่างเช่น Common Crawl ระบุว่าโฮสต์ของ CCBot จะแปลงชื่อเป็น *.crawl.commoncrawl.org ให้ตรวจสอบว่า hostname แปลงกลับเป็น address เดิมก่อนเชื่อถือ

Agents หันมาเซ็นคำขอด้วย HTTP Message Signatures (RFC 9421) ตามร่าง Web Bot Auth มากขึ้น คำขอจะระบุผู้ให้บริการไว้ใน Signature-Agent และคุณตรวจสอบลายเซ็นได้ด้วย public keys ที่ /.well-known/http-message-signatures-directory ของโดเมนนั้น ลายเซ็นที่ถูกต้องยืนยันผู้ให้บริการได้ แต่ไม่ได้ยืนยันผู้ใช้ที่อยู่เบื้องหลังหรือสิ่งที่ผู้ใช้นั้นทำได้

สร้าง robots.txt จากรายการนี้ →

คำถามเกี่ยวกับ AI crawler

AI crawler ตัวใดบ้างที่ไม่ทำตาม robots.txt?

ตามเอกสารของผู้ให้บริการ ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher และ facebookexternalhit อาจไม่ทำตาม robots.txt ส่วนใหญ่เพราะเป็นการดึงข้อมูลที่ผู้ใช้เป็นผู้เรียกใช้ รายงานจากชุมชนระบุว่า Bytespider ไม่เคารพ robots.txt

GPTBot, OAI-SearchBot และ ChatGPT-User ต่างกันอย่างไร?

GPTBot รวบรวมหน้าเว็บเพื่อฝึกโมเดลของ OpenAI, OAI-SearchBot จัดทำดัชนีหน้าเว็บสำหรับการค้นหาของ ChatGPT และ ChatGPT-User ดึงหน้าเว็บเมื่อมีคนร้องขอ สองตัวแรกทำตาม robots.txt ส่วน OpenAI ระบุว่ากฎอาจไม่มีผลกับตัวที่สาม

AI agent ตัวใดบ้างที่ไม่มี token สำหรับ robots.txt?

ChatGPT agent, Gemini Spark และ Muse ของ Meta โดยยืนยัน ChatGPT agent ได้จากลายเซ็น Web Bot Auth ที่มาจาก https://chatgpt.com ส่วน Gemini Spark ในโหมด Chrome ภายในเครื่องจะมีลักษณะเหมือนเบราว์เซอร์ของผู้ใช้เอง และ Muse ไม่มี user agent ที่เผยแพร่ไว้

จะตรวจสอบได้อย่างไรว่าคำขอมาจาก Googlebot จริง?

Google เผยแพร่ช่วง IP ของ Googlebot เป็นไฟล์ JSON ซึ่งลิงก์ไว้ในรายการของ Googlebot ในไดเรกทอรีนี้ ให้ตรวจสอบ address ของคำขอกับช่วง IP เหล่านั้น แทนที่จะเชื่อสตริง user-agent

รายการ AI bot นี้มาจากไหน?

แต่ละรายการจะลิงก์ไปยังเอกสารของผู้ให้บริการ หากมี ส่วน token ที่ไม่มีเอกสารอ้างอิงมาจากทะเบียน ai.robots.txt ของชุมชน เราไม่รวม DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin และ PetalBot เพราะไม่พบเอกสารจากผู้ให้บริการ รายการนี้ตรวจสอบเมื่อ 1 October 2026