dotsagent.io
Ngôn ngữ:Tiếng Việt
Common Crawl · Huấn luyện

CCBot là gì?

Crawler của Common Crawl, dùng để xây dựng kho ngữ liệu web mở được sử dụng rộng rãi để huấn luyện các model AI. Crawler này tuân theo robots.txt.

Token robots.txt
CCBot
Nhà vận hành
Common Crawl
Mục đích
Huấn luyện
Tuân theo robots.txt
Có Nhà vận hành cho biết bot này tuân thủ robots.txt.
Có tài liệu từ nhà vận hành
Có, trên các trang của chính nhà vận hành.
Danh sách IP được công bố
index.commoncrawl.org/ccbot.json
Tài liệu
commoncrawl.org

Các máy chủ của crawler này phân giải thành *.crawl.commoncrawl.org khi tra cứu DNS ngược; Common Crawl cũng công bố danh sách IP.

Chặn CCBot trên toàn bộ trang web

robots.txt
User-agent: CCBot
Disallow: /

Cho phép bot này, nhưng không cho truy cập các đường dẫn riêng tư

robots.txt
User-agent: CCBot
Allow: /
Disallow: /admin/

Thêm bot này vào robots.txt trong trình tạo →

Nguồn

  1. commoncrawl.org/ccbot