---
title: "CCBot: i-block o payagan ang AI crawler na ito · DotsAgent"
description: "Pinapatakbo ng Common Crawl ang CCBot, na nakalista sa ilalim ng pagsasanay. Alamin ang robots.txt token nito, kung sumusunod ito sa mga patakaran, ang IP list nito at kung paano ito kontrolin."
url: https://dotsagent.io/fil/agent-ready/bots/ccbot
---

Common Crawl · Pagsasanay

# Ano ang CCBot?

Crawler ng Common Crawl na bumubuo ng bukas na web corpus na malawakang ginagamit sa pagsasanay ng mga AI model. Sinusunod nito ang robots.txt.

- **robots.txt token**: `CCBot`
- **Operator**: Common Crawl
- **Layunin**: Pagsasanay
- **Sumusunod sa robots.txt**: Ayon sa operator, sumusunod ito sa robots.txt.
- **May dokumentasyon mula sa operator**: Oo, sa mga page mismo ng operator.
- **Inilathalang IP list**: [index.commoncrawl.org/ccbot.json](https://index.commoncrawl.org/ccbot.json)
- **Dokumentasyon**: [commoncrawl.org](https://commoncrawl.org/ccbot)

Sa reverse DNS, nare-resolve ang mga host nito sa *.crawl.commoncrawl.org, at naglalathala ang Common Crawl ng listahan ng IP.

## I-block ang CCBot sa buong site mo

`robots.txt`

```
User-agent: CCBot
Disallow: /
```

## Payagan ito, pero ilayo sa mga pribadong path

`robots.txt`

```
User-agent: CCBot
Allow: /
Disallow: /admin/
```

[Idagdag ito sa robots.txt sa generator →](https://dotsagent.io/fil/agent-ready/robots-txt)

## Mga source

1. [commoncrawl.org](https://commoncrawl.org/ccbot)/ccbot

Independent na sanggunian para sa mga gumagawa ng AI agent. Hindi kami kaanib ng alinman sa mga vendor na nakalista rito.

© 2026 DotsAgent · Sinuri ang mga detalye noong Oktubre 1, 2026
