Common Crawl · 学習
CCBotとは?
Common Crawlのクローラーです。AIモデルのトレーニングに広く使われる、オープンなWebコーパスを構築します。robots.txtに従います。
- robots.txtトークン
CCBot- 運営者
- Common Crawl
- 用途
- 学習
- robots.txtへの準拠
- はい 運営者は、robots.txt に従うと明言しています。
- 運営者によるドキュメント
- はい。運営者自身のページに記載されています。
- 公開IPリスト
- index.commoncrawl.org/ccbot.json
- ドキュメント
- commoncrawl.org
ホストの逆引きDNS名は*.crawl.commoncrawl.orgに解決され、Common CrawlはIPリストを公開しています。
サイト全体で CCBot をブロックする
User-agent: CCBot
Disallow: /
許可しつつ、非公開パスへのアクセスを防ぐ
User-agent: CCBot
Allow: /
Disallow: /admin/