---
title: "CCBot：屏蔽或允许此 AI 爬虫 · DotsAgent"
description: "CCBot 由 Common Crawl 运营，归类为「训练」。了解其 robots.txt token、是否遵守规则、IP 列表及控制方法。"
url: https://dotsagent.io/zh/agent-ready/bots/ccbot
---

Common Crawl · 训练

# CCBot 是什么？

Common Crawl 的爬虫，用于构建开放网络语料库，该语料库广泛用于训练 AI 模型。它遵守 robots.txt。

- **robots.txt token**: `CCBot`
- **运营方**: Common Crawl
- **用途**: 训练
- **是否遵守 robots.txt**: 运营方表示该爬虫遵守 robots.txt。
- **运营方是否提供文档**: 是，运营方在其自有页面上有相关说明。
- **公开的 IP 列表**: [index.commoncrawl.org/ccbot.json](https://index.commoncrawl.org/ccbot.json)
- **文档**: [commoncrawl.org](https://commoncrawl.org/ccbot)

其主机的反向 DNS 解析结果为 *.crawl.commoncrawl.org，且 Common Crawl 会公布 IP 列表。

## 在整个网站上屏蔽 CCBot

`robots.txt`

```
User-agent: CCBot
Disallow: /
```

## 允许访问，但屏蔽私有路径

`robots.txt`

```
User-agent: CCBot
Allow: /
Disallow: /admin/
```

[在生成器中将其添加到 robots.txt →](https://dotsagent.io/zh/agent-ready/robots-txt)

## 来源

1. [commoncrawl.org](https://commoncrawl.org/ccbot)/ccbot

为 AI agent 开发者提供的独立参考资料。与此处提及的任何厂商均无关联。

© 2026 DotsAgent · 事实核查日期：2026年10月1日
