Common Crawl · Entrenamiento
¿Qué es CCBot?
Crawler de Common Crawl, que crea un corpus web abierto muy utilizado para entrenar modelos de IA. Respeta robots.txt.
- Token de robots.txt
CCBot- Operador
- Common Crawl
- Propósito
- Entrenamiento
- Respeta robots.txt
- Sí El operador indica que respeta robots.txt.
- Documentado por el operador
- Sí, en las páginas oficiales del operador.
- Lista de IP publicada
- index.commoncrawl.org/ccbot.json
- Documentación
- commoncrawl.org
Sus hosts resuelven a *.crawl.commoncrawl.org mediante DNS inverso, y Common Crawl publica una lista de IP.
Bloquea CCBot en todo tu sitio
User-agent: CCBot
Disallow: /
Permítelo, pero excluye las rutas privadas
User-agent: CCBot
Allow: /
Disallow: /admin/
Añádelo a un robots.txt en el generador →