Common Crawl · 训练
CCBot 是什么?
Common Crawl 的爬虫,用于构建开放网络语料库,该语料库广泛用于训练 AI 模型。它遵守 robots.txt。
- robots.txt token
CCBot- 运营方
- Common Crawl
- 用途
- 训练
- 是否遵守 robots.txt
- 是 运营方表示该爬虫遵守 robots.txt。
- 运营方是否提供文档
- 是,运营方在其自有页面上有相关说明。
- 公开的 IP 列表
- index.commoncrawl.org/ccbot.json
- 文档
- commoncrawl.org
其主机的反向 DNS 解析结果为 *.crawl.commoncrawl.org,且 Common Crawl 会公布 IP 列表。
在整个网站上屏蔽 CCBot
User-agent: CCBot
Disallow: /
允许访问,但屏蔽私有路径
User-agent: CCBot
Allow: /
Disallow: /admin/