Common Crawl · การฝึกโมเดล
CCBot คืออะไร?
crawler ของ Common Crawl ซึ่งสร้างคลังข้อมูลเว็บแบบเปิดที่มีการนำไปใช้ฝึกโมเดล AI อย่างแพร่หลาย โดยปฏิบัติตาม robots.txt
- token สำหรับ robots.txt
CCBot- ผู้ให้บริการ
- Common Crawl
- วัตถุประสงค์
- การฝึกโมเดล
- ทำตาม robots.txt
- ใช่ ผู้ให้บริการระบุว่าบอตนี้ปฏิบัติตาม robots.txt
- มีเอกสารจากผู้ให้บริการ
- มีระบุไว้ในหน้าเว็บของผู้ให้บริการ
- รายการ IP ที่เผยแพร่
- index.commoncrawl.org/ccbot.json
- เอกสาร
- commoncrawl.org
โฮสต์ของ crawler นี้ resolve เป็น *.crawl.commoncrawl.org เมื่อค้นหา reverse DNS และ Common Crawl เผยแพร่รายการ IP ไว้
บล็อก CCBot จากทั้งเว็บไซต์
User-agent: CCBot
Disallow: /
อนุญาตให้เข้าถึง แต่กันเส้นทางส่วนตัวไว้
User-agent: CCBot
Allow: /
Disallow: /admin/
เพิ่มลงใน robots.txt ใน generator →