ไดเรกทอรี AI crawler และ agent
รวม AI bot ทุกรายที่เรายืนยันได้ พร้อม token สำหรับใช้ใน robots.txt วัตถุประสงค์ในการดึงข้อมูล คำยืนยันจากผู้ให้บริการว่า bot ปฏิบัติตามกฎหรือไม่ และวิธีตรวจสอบว่าคำขอมาจาก bot นั้นจริงหรือไม่ สำหรับ token ที่พบเฉพาะในทะเบียน ai.robots.txt ของชุมชน จะมีการระบุไว้ในหน้าเฉพาะของแต่ละรายการ
| Bot | Token | วัตถุประสงค์ | ปฏิบัติตาม robots.txt | ตรวจสอบ |
|---|---|---|---|---|
| GPTBot | GPTBot | การฝึกโมเดล | ใช่ | รายการ IP |
| OAI-SearchBot | OAI-SearchBot | การค้นหา | ใช่ | รายการ IP |
| ChatGPT-User | ChatGPT-User | การดึงข้อมูลโดยผู้ใช้ | ไม่ | รายการ IP |
| OAI-AdsBot | OAI-AdsBot | โฆษณา | ไม่ได้ระบุ | รายการ IP |
| ChatGPT agent | ไม่มี token | Agents | ไม่ได้ระบุ | คำขอที่ลงลายเซ็น |
| ClaudeBot | ClaudeBot | การฝึกโมเดล | ใช่ | รายการ IP |
| Claude-SearchBot | Claude-SearchBot | การค้นหา | ใช่ | รายการ IP |
| Claude-User | Claude-User | การดึงข้อมูลโดยผู้ใช้ | ใช่ | รายการ IP |
| Googlebot | Googlebot | การค้นหา | ใช่ | รายการ IP |
| Google-Extended | Google-Extended | การฝึกโมเดล | ใช่ | — |
| Google-CloudVertexBot | Google-CloudVertexBot | การค้นหา | ใช่ | รายการ IP |
| GoogleOther | GoogleOther | การฝึกโมเดล | ใช่ | รายการ IP |
| Google-Agent | Google-Agent | Agents | ไม่ | รายการ IP |
| Google-GeminiNotebook | Google-GeminiNotebook | การดึงข้อมูลโดยผู้ใช้ | ไม่ | รายการ IP |
| Gemini Spark | ไม่มี token | Agents | ไม่ได้ระบุ | — |
| Gemini-Deep-Research | Gemini-Deep-Research | การดึงข้อมูลโดยผู้ใช้ | ไม่ได้ระบุ | — |
| GoogleAgent-Mariner | GoogleAgent-Mariner | Agents | ไม่ได้ระบุ | — |
| Applebot | Applebot | การค้นหา | ใช่ | รายการ IP |
| Applebot-Extended | Applebot-Extended | การฝึกโมเดล | ใช่ | — |
| PerplexityBot | PerplexityBot | การค้นหา | ใช่ | รายการ IP |
| Perplexity-User | Perplexity-User | การดึงข้อมูลโดยผู้ใช้ | ไม่ | รายการ IP |
| meta-externalagent | meta-externalagent | การฝึกโมเดล | ใช่ | — |
| meta-webindexer | meta-webindexer | การค้นหา | ใช่ | — |
| meta-externalfetcher | meta-externalfetcher | การดึงข้อมูลโดยผู้ใช้ | ไม่ | — |
| meta-externalads | meta-externalads | โฆษณา | ใช่ | — |
| facebookexternalhit | facebookexternalhit | การดึงข้อมูลโดยผู้ใช้ | ไม่ | — |
| Muse | ไม่มี token | Agents | ไม่ได้ระบุ | — |
| Amazonbot | Amazonbot | การฝึกโมเดล | ใช่ | รายการ IP |
| Amzn-SearchBot | Amzn-SearchBot | การค้นหา | ใช่ | รายการ IP |
| Amzn-User | Amzn-User | การดึงข้อมูลโดยผู้ใช้ | ไม่ | รายการ IP |
| DuckAssistBot | DuckAssistBot | การค้นหา | ใช่ | รายการ IP |
| MistralAI-User | MistralAI-User | การดึงข้อมูลโดยผู้ใช้ | ใช่ | รายการ IP |
| MistralAI-Index | MistralAI-Index | การค้นหา | ใช่ | รายการ IP |
| MistralAI-Training | MistralAI-Training | การฝึกโมเดล | ใช่ | — |
| CCBot | CCBot | การฝึกโมเดล | ใช่ | รายการ IP |
| cohere-ai | cohere-ai | การดึงข้อมูลโดยผู้ใช้ | ไม่ได้ระบุ | — |
| Bytespider | Bytespider | การฝึกโมเดล | ไม่ | — |
| YouBot | YouBot | การค้นหา | ไม่ได้ระบุ | — |
| Diffbot | Diffbot | การค้นหา | ไม่ได้ระบุ | — |
| Timpibot | Timpibot | การฝึกโมเดล | ไม่ได้ระบุ | — |
ความหมายของวัตถุประสงค์
- การฝึกโมเดล
- รวบรวมหน้าเว็บเพื่อฝึกโมเดลหรือ crawl เพื่อการวิจัยทั่วไป Google-Extended และ Applebot-Extended เป็น control token ที่ไม่ดึงข้อมูลด้วยตัวเอง
- การค้นหา
- จัดทำดัชนีหน้าเว็บสำหรับผลิตภัณฑ์ค้นหา ตั้งแต่ Google Search ไปจนถึงระบบ AI ที่ตอบคำถาม เช่น ChatGPT search, Perplexity และ DuckAssist การบล็อก bot จะทำให้เว็บไซต์ของคุณไม่ปรากฏในผลิตภัณฑ์นั้น
- การดึงข้อมูลโดยผู้ใช้
- ดึงหน้าเว็บตามคำขอของผู้ใช้ผ่านแชตหรือเครื่องมือ ผู้ให้บริการหลายรายระบุว่า robots.txt อาจไม่มีผลกับคำขอเหล่านี้
- Agents
- เปิดดูเว็บและดำเนินการแทนผู้ใช้ โดยมักทำงานผ่านเบราว์เซอร์เต็มรูปแบบ หลายรายไม่มี token และอาจตรวจสอบได้จากลายเซ็นเท่านั้น หากมี
- โฆษณา
- ตรวจสอบหน้า Landing Page ของโฆษณาที่ผู้ลงโฆษณาส่งมา ไม่รวมรายการเหล่านี้ในตัวสร้าง robots.txt
ตรวจสอบว่าบอตเป็นตัวจริงตามที่อ้างหรือไม่
ปลอมสตริง user-agent ได้โดยไม่มีค่าใช้จ่าย ผู้ให้บริการรายใหญ่ส่วนใหญ่เผยแพร่ช่วง IP ที่บอตใช้เป็นไฟล์ JSON โดยระบุไว้ในตารางว่าเป็นรายการ IP ให้เปรียบเทียบ address ของคำขอกับรายการของ token นั้น และอย่าถือว่าการที่ชื่อเพียงอย่างเดียวตรงกันเป็นการยืนยันตัวตน
ผู้ให้บริการบางรายยังบันทึกข้อมูล reverse DNS ไว้ด้วย ตัวอย่างเช่น Common Crawl ระบุว่าโฮสต์ของ CCBot จะแปลงชื่อเป็น *.crawl.commoncrawl.org ให้ตรวจสอบว่า hostname แปลงกลับเป็น address เดิมก่อนเชื่อถือ
Agents หันมาเซ็นคำขอด้วย HTTP Message Signatures (RFC 9421) ตามร่าง Web Bot Auth มากขึ้น คำขอจะระบุผู้ให้บริการไว้ใน Signature-Agent และคุณตรวจสอบลายเซ็นได้ด้วย public keys ที่ /.well-known/http-message-signatures-directory ของโดเมนนั้น ลายเซ็นที่ถูกต้องยืนยันผู้ให้บริการได้ แต่ไม่ได้ยืนยันผู้ใช้ที่อยู่เบื้องหลังหรือสิ่งที่ผู้ใช้นั้นทำได้
สร้าง robots.txt จากรายการนี้ →
คำถามเกี่ยวกับ AI crawler
AI crawler ตัวใดบ้างที่ไม่ทำตาม robots.txt?
ตามเอกสารของผู้ให้บริการ ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher และ facebookexternalhit อาจไม่ทำตาม robots.txt ส่วนใหญ่เพราะเป็นการดึงข้อมูลที่ผู้ใช้เป็นผู้เรียกใช้ รายงานจากชุมชนระบุว่า Bytespider ไม่เคารพ robots.txt
GPTBot, OAI-SearchBot และ ChatGPT-User ต่างกันอย่างไร?
GPTBot รวบรวมหน้าเว็บเพื่อฝึกโมเดลของ OpenAI, OAI-SearchBot จัดทำดัชนีหน้าเว็บสำหรับการค้นหาของ ChatGPT และ ChatGPT-User ดึงหน้าเว็บเมื่อมีคนร้องขอ สองตัวแรกทำตาม robots.txt ส่วน OpenAI ระบุว่ากฎอาจไม่มีผลกับตัวที่สาม
AI agent ตัวใดบ้างที่ไม่มี token สำหรับ robots.txt?
ChatGPT agent, Gemini Spark และ Muse ของ Meta โดยยืนยัน ChatGPT agent ได้จากลายเซ็น Web Bot Auth ที่มาจาก https://chatgpt.com ส่วน Gemini Spark ในโหมด Chrome ภายในเครื่องจะมีลักษณะเหมือนเบราว์เซอร์ของผู้ใช้เอง และ Muse ไม่มี user agent ที่เผยแพร่ไว้
จะตรวจสอบได้อย่างไรว่าคำขอมาจาก Googlebot จริง?
Google เผยแพร่ช่วง IP ของ Googlebot เป็นไฟล์ JSON ซึ่งลิงก์ไว้ในรายการของ Googlebot ในไดเรกทอรีนี้ ให้ตรวจสอบ address ของคำขอกับช่วง IP เหล่านั้น แทนที่จะเชื่อสตริง user-agent
รายการ AI bot นี้มาจากไหน?
แต่ละรายการจะลิงก์ไปยังเอกสารของผู้ให้บริการ หากมี ส่วน token ที่ไม่มีเอกสารอ้างอิงมาจากทะเบียน ai.robots.txt ของชุมชน เราไม่รวม DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin และ PetalBot เพราะไม่พบเอกสารจากผู้ให้บริการ รายการนี้ตรวจสอบเมื่อ 1 October 2026