Common Crawl · Treinamento
O que é CCBot?
Crawler do Common Crawl, que cria um corpus aberto da web amplamente usado para treinar modelos de IA. Ele respeita robots.txt.
- Token para robots.txt
CCBot- Operador
- Common Crawl
- Finalidade
- Treinamento
- Obedece ao robots.txt
- Sim O operador informa que segue o robots.txt.
- Documentado pelo operador
- Sim, nas páginas do próprio operador.
- Lista de IPs publicada
- index.commoncrawl.org/ccbot.json
- Documentação
- commoncrawl.org
Os hosts resolvem para *.crawl.commoncrawl.org via DNS reverso, e o Common Crawl publica uma lista de IPs.
Bloqueie CCBot em todo o seu site
User-agent: CCBot
Disallow: /
Permita o acesso, mas proteja os caminhos privados
User-agent: CCBot
Allow: /
Disallow: /admin/
Adicione-o ao robots.txt no gerador →