---
title: "CCBot : bloquer ou autoriser ce crawler IA · DotsAgent"
description: "CCBot est exploité par Common Crawl et répertorié sous entraînement. Découvrez son token robots.txt, s’il respecte les règles, sa liste d’adresses IP et comment le contrôler."
url: https://dotsagent.io/fr/agent-ready/bots/ccbot
---

Common Crawl · Entraînement

# Qu’est-ce que CCBot ?

Le crawler de Common Crawl, qui constitue un corpus Web ouvert largement utilisé pour entraîner des modèles d’IA. Il respecte robots.txt.

- **Token robots.txt**: `CCBot`
- **Opérateur**: Common Crawl
- **Objectif**: Entraînement
- **Respecte robots.txt**: L’opérateur indique que le bot respecte robots.txt.
- **Documenté par l’opérateur**: Oui, sur les pages de l’opérateur.
- **Liste d’adresses IP publiée**: [index.commoncrawl.org/ccbot.json](https://index.commoncrawl.org/ccbot.json)
- **Documentation**: [commoncrawl.org](https://commoncrawl.org/ccbot)

La résolution DNS inverse de ses hôtes renvoie vers *.crawl.commoncrawl.org, et Common Crawl publie une liste d’adresses IP.

## Bloquer CCBot sur tout votre site

`robots.txt`

```
User-agent: CCBot
Disallow: /
```

## L’autoriser, mais exclure les chemins privés

`robots.txt`

```
User-agent: CCBot
Allow: /
Disallow: /admin/
```

[L’ajouter à un robots.txt dans le générateur →](https://dotsagent.io/fr/agent-ready/robots-txt)

## Sources

1. [commoncrawl.org](https://commoncrawl.org/ccbot)/ccbot

Référence indépendante pour les personnes qui créent des agents IA. Sans affiliation avec les fournisseurs cités.

© 2026 DotsAgent · Données vérifiées le 1 octobre 2026
