Common Crawl · Training
Wat is CCBot?
De crawler van Common Crawl, die een open webcorpus samenstelt dat veel wordt gebruikt om AI-modellen te trainen. Volgt robots.txt.
- robots.txt-token
CCBot- Operator
- Common Crawl
- Doel
- Training
- Volgt robots.txt
- Ja De beheerder zegt dat deze robots.txt volgt.
- Gedocumenteerd door operator
- Ja, op de eigen pagina's van de beheerder.
- Gepubliceerde IP-lijst
- index.commoncrawl.org/ccbot.json
- Documentatie
- commoncrawl.org
De hosts verwijzen via reverse DNS naar *.crawl.commoncrawl.org, en Common Crawl publiceert een IP-lijst.
Blokkeer CCBot op je hele site
User-agent: CCBot
Disallow: /
Sta deze toe, maar sluit privé-paden uit
User-agent: CCBot
Allow: /
Disallow: /admin/
Voeg deze toe aan een robots.txt in de generator →