---
title: "CCBot: chặn hoặc cho phép crawler AI này · DotsAgent"
description: "CCBot do Common Crawl vận hành và được xếp vào mục huấn luyện. Tìm hiểu token robots.txt, mức độ tuân thủ quy tắc, danh sách IP và cách kiểm soát bot."
url: https://dotsagent.io/vi/agent-ready/bots/ccbot
---

Common Crawl · Huấn luyện

# CCBot là gì?

Crawler của Common Crawl, dùng để xây dựng kho ngữ liệu web mở được sử dụng rộng rãi để huấn luyện các model AI. Crawler này tuân theo robots.txt.

- **Token robots.txt**: `CCBot`
- **Nhà vận hành**: Common Crawl
- **Mục đích**: Huấn luyện
- **Tuân theo robots.txt**: Nhà vận hành cho biết bot này tuân thủ robots.txt.
- **Có tài liệu từ nhà vận hành**: Có, trên các trang của chính nhà vận hành.
- **Danh sách IP được công bố**: [index.commoncrawl.org/ccbot.json](https://index.commoncrawl.org/ccbot.json)
- **Tài liệu**: [commoncrawl.org](https://commoncrawl.org/ccbot)

Các máy chủ của crawler này phân giải thành *.crawl.commoncrawl.org khi tra cứu DNS ngược; Common Crawl cũng công bố danh sách IP.

## Chặn CCBot trên toàn bộ trang web

`robots.txt`

```
User-agent: CCBot
Disallow: /
```

## Cho phép bot này, nhưng không cho truy cập các đường dẫn riêng tư

`robots.txt`

```
User-agent: CCBot
Allow: /
Disallow: /admin/
```

[Thêm bot này vào robots.txt trong trình tạo →](https://dotsagent.io/vi/agent-ready/robots-txt)

## Nguồn

1. [commoncrawl.org](https://commoncrawl.org/ccbot)/ccbot

Tài liệu tham khảo độc lập dành cho những người xây dựng AI agent. Không liên kết với bất kỳ nhà cung cấp nào được nêu ở đây.

© 2026 DotsAgent · Dữ liệu được kiểm tra ngày 1 tháng 10, 2026
