dotsagent.io
Idioma:Português
Common Crawl · Treinamento

O que é CCBot?

Crawler do Common Crawl, que cria um corpus aberto da web amplamente usado para treinar modelos de IA. Ele respeita robots.txt.

Token para robots.txt
CCBot
Operador
Common Crawl
Finalidade
Treinamento
Obedece ao robots.txt
Sim O operador informa que segue o robots.txt.
Documentado pelo operador
Sim, nas páginas do próprio operador.
Lista de IPs publicada
index.commoncrawl.org/ccbot.json
Documentação
commoncrawl.org

Os hosts resolvem para *.crawl.commoncrawl.org via DNS reverso, e o Common Crawl publica uma lista de IPs.

Bloqueie CCBot em todo o seu site

robots.txt
User-agent: CCBot
Disallow: /

Permita o acesso, mas proteja os caminhos privados

robots.txt
User-agent: CCBot
Allow: /
Disallow: /admin/

Adicione-o ao robots.txt no gerador →

Fontes

  1. commoncrawl.org/ccbot

Referência independente para quem cria agentes de IA. Não temos vínculo com nenhum dos fornecedores mencionados aqui.

© 2026 DotsAgent · Fatos verificados em 1 de outubro de 2026