Common Crawl · Entraînement
Qu’est-ce que CCBot ?
Le crawler de Common Crawl, qui constitue un corpus Web ouvert largement utilisé pour entraîner des modèles d’IA. Il respecte robots.txt.
- Token robots.txt
CCBot- Opérateur
- Common Crawl
- Objectif
- Entraînement
- Respecte robots.txt
- Oui L’opérateur indique que le bot respecte robots.txt.
- Documenté par l’opérateur
- Oui, sur les pages de l’opérateur.
- Liste d’adresses IP publiée
- index.commoncrawl.org/ccbot.json
- Documentation
- commoncrawl.org
La résolution DNS inverse de ses hôtes renvoie vers *.crawl.commoncrawl.org, et Common Crawl publie une liste d’adresses IP.
Bloquer CCBot sur tout votre site
User-agent: CCBot
Disallow: /
L’autoriser, mais exclure les chemins privés
User-agent: CCBot
Allow: /
Disallow: /admin/
L’ajouter à un robots.txt dans le générateur →