Common Crawl · Addestramento
Che cos'è CCBot?
Crawler di Common Crawl, che crea un corpus web aperto ampiamente usato per addestrare modelli AI. Rispetta robots.txt.
- Token robots.txt
CCBot- Operatore
- Common Crawl
- Scopo
- Addestramento
- Rispetta robots.txt
- Sì L'operatore dichiara che rispetta robots.txt.
- Documentato dall'operatore
- Sì, nelle pagine dell'operatore.
- Elenco IP pubblicato
- index.commoncrawl.org/ccbot.json
- Documentazione
- commoncrawl.org
I suoi host si risolvono in *.crawl.commoncrawl.org tramite DNS inverso e Common Crawl pubblica un elenco IP.
Blocca CCBot su tutto il sito
User-agent: CCBot
Disallow: /
Consenti l'accesso, ma escludi i percorsi privati
User-agent: CCBot
Allow: /
Disallow: /admin/
Aggiungilo a robots.txt nel generatore →