dotsagent.io
Langue:Français
Common Crawl · Entraînement

Qu’est-ce que CCBot ?

Le crawler de Common Crawl, qui constitue un corpus Web ouvert largement utilisé pour entraîner des modèles d’IA. Il respecte robots.txt.

Token robots.txt
CCBot
Opérateur
Common Crawl
Objectif
Entraînement
Respecte robots.txt
Oui L’opérateur indique que le bot respecte robots.txt.
Documenté par l’opérateur
Oui, sur les pages de l’opérateur.
Liste d’adresses IP publiée
index.commoncrawl.org/ccbot.json
Documentation
commoncrawl.org

La résolution DNS inverse de ses hôtes renvoie vers *.crawl.commoncrawl.org, et Common Crawl publie une liste d’adresses IP.

Bloquer CCBot sur tout votre site

robots.txt
User-agent: CCBot
Disallow: /

L’autoriser, mais exclure les chemins privés

robots.txt
User-agent: CCBot
Allow: /
Disallow: /admin/

L’ajouter à un robots.txt dans le générateur →

Sources

  1. commoncrawl.org/ccbot