dotsagent.io
ภาษา:ไทย
Common Crawl · การฝึกโมเดล

CCBot คืออะไร?

crawler ของ Common Crawl ซึ่งสร้างคลังข้อมูลเว็บแบบเปิดที่มีการนำไปใช้ฝึกโมเดล AI อย่างแพร่หลาย โดยปฏิบัติตาม robots.txt

token สำหรับ robots.txt
CCBot
ผู้ให้บริการ
Common Crawl
วัตถุประสงค์
การฝึกโมเดล
ทำตาม robots.txt
ใช่ ผู้ให้บริการระบุว่าบอตนี้ปฏิบัติตาม robots.txt
มีเอกสารจากผู้ให้บริการ
มีระบุไว้ในหน้าเว็บของผู้ให้บริการ
รายการ IP ที่เผยแพร่
index.commoncrawl.org/ccbot.json
เอกสาร
commoncrawl.org

โฮสต์ของ crawler นี้ resolve เป็น *.crawl.commoncrawl.org เมื่อค้นหา reverse DNS และ Common Crawl เผยแพร่รายการ IP ไว้

บล็อก CCBot จากทั้งเว็บไซต์

robots.txt
User-agent: CCBot
Disallow: /

อนุญาตให้เข้าถึง แต่กันเส้นทางส่วนตัวไว้

robots.txt
User-agent: CCBot
Allow: /
Disallow: /admin/

เพิ่มลงใน robots.txt ใน generator →

แหล่งข้อมูล

  1. commoncrawl.org/ccbot