dotsagent.io
Lingua:Italiano
Common Crawl · Addestramento

Che cos'è CCBot?

Crawler di Common Crawl, che crea un corpus web aperto ampiamente usato per addestrare modelli AI. Rispetta robots.txt.

Token robots.txt
CCBot
Operatore
Common Crawl
Scopo
Addestramento
Rispetta robots.txt
Sì L'operatore dichiara che rispetta robots.txt.
Documentato dall'operatore
Sì, nelle pagine dell'operatore.
Elenco IP pubblicato
index.commoncrawl.org/ccbot.json
Documentazione
commoncrawl.org

I suoi host si risolvono in *.crawl.commoncrawl.org tramite DNS inverso e Common Crawl pubblica un elenco IP.

Blocca CCBot su tutto il sito

robots.txt
User-agent: CCBot
Disallow: /

Consenti l'accesso, ma escludi i percorsi privati

robots.txt
User-agent: CCBot
Allow: /
Disallow: /admin/

Aggiungilo a robots.txt nel generatore →

Fonti

  1. commoncrawl.org/ccbot