---
title: "CCBot: bloquear o permitir este rastreador de IA · DotsAgent"
description: "CCBot está a cargo de Common Crawl y figura con el propósito entrenamiento. Su token de robots.txt, si respeta las reglas, su lista de IP y cómo controlarlo."
url: https://dotsagent.io/es/agent-ready/bots/ccbot
---

Common Crawl · Entrenamiento

# ¿Qué es CCBot?

Crawler de Common Crawl, que crea un corpus web abierto muy utilizado para entrenar modelos de IA. Respeta robots.txt.

- **Token de robots.txt**: `CCBot`
- **Operador**: Common Crawl
- **Propósito**: Entrenamiento
- **Respeta robots.txt**: El operador indica que respeta robots.txt.
- **Documentado por el operador**: Sí, en las páginas oficiales del operador.
- **Lista de IP publicada**: [index.commoncrawl.org/ccbot.json](https://index.commoncrawl.org/ccbot.json)
- **Documentación**: [commoncrawl.org](https://commoncrawl.org/ccbot)

Sus hosts resuelven a *.crawl.commoncrawl.org mediante DNS inverso, y Common Crawl publica una lista de IP.

## Bloquea CCBot en todo tu sitio

`robots.txt`

```
User-agent: CCBot
Disallow: /
```

## Permítelo, pero excluye las rutas privadas

`robots.txt`

```
User-agent: CCBot
Allow: /
Disallow: /admin/
```

[Añádelo a un robots.txt en el generador →](https://dotsagent.io/es/agent-ready/robots-txt)

## Fuentes

1. [commoncrawl.org](https://commoncrawl.org/ccbot)/ccbot

Referencia independiente para quienes crean agentes de IA. No estamos afiliados a ninguno de los proveedores mencionados aquí.

© 2026 DotsAgent · Datos verificados el 1 de octubre de 2026
