dotsagent.io
语言:简体中文
Common Crawl · 训练

CCBot 是什么?

Common Crawl 的爬虫,用于构建开放网络语料库,该语料库广泛用于训练 AI 模型。它遵守 robots.txt。

robots.txt token
CCBot
运营方
Common Crawl
用途
训练
是否遵守 robots.txt
是 运营方表示该爬虫遵守 robots.txt。
运营方是否提供文档
是,运营方在其自有页面上有相关说明。
公开的 IP 列表
index.commoncrawl.org/ccbot.json
文档
commoncrawl.org

其主机的反向 DNS 解析结果为 *.crawl.commoncrawl.org,且 Common Crawl 会公布 IP 列表。

在整个网站上屏蔽 CCBot

robots.txt
User-agent: CCBot
Disallow: /

允许访问,但屏蔽私有路径

robots.txt
User-agent: CCBot
Allow: /
Disallow: /admin/

在生成器中将其添加到 robots.txt →

来源

  1. commoncrawl.org/ccbot

为 AI agent 开发者提供的独立参考资料。与此处提及的任何厂商均无关联。

© 2026 DotsAgent · 事实核查日期:2026年10月1日