Common Crawl · Huấn luyện
CCBot là gì?
Crawler của Common Crawl, dùng để xây dựng kho ngữ liệu web mở được sử dụng rộng rãi để huấn luyện các model AI. Crawler này tuân theo robots.txt.
- Token robots.txt
CCBot- Nhà vận hành
- Common Crawl
- Mục đích
- Huấn luyện
- Tuân theo robots.txt
- Có Nhà vận hành cho biết bot này tuân thủ robots.txt.
- Có tài liệu từ nhà vận hành
- Có, trên các trang của chính nhà vận hành.
- Danh sách IP được công bố
- index.commoncrawl.org/ccbot.json
- Tài liệu
- commoncrawl.org
Các máy chủ của crawler này phân giải thành *.crawl.commoncrawl.org khi tra cứu DNS ngược; Common Crawl cũng công bố danh sách IP.
Chặn CCBot trên toàn bộ trang web
User-agent: CCBot
Disallow: /
Cho phép bot này, nhưng không cho truy cập các đường dẫn riêng tư
User-agent: CCBot
Allow: /
Disallow: /admin/
Thêm bot này vào robots.txt trong trình tạo →