---
title: "CCBot: diesen KI-Crawler blockieren oder zulassen · DotsAgent"
description: "CCBot wird von Common Crawl betrieben und ist dem Zweck training zugeordnet. Der robots.txt-Token, ob sich der Bot an die Regeln hält, seine IP-Liste und Möglichkeiten, ihn zu steuern."
url: https://dotsagent.io/de/agent-ready/bots/ccbot
---

Common Crawl · Training

# Was ist CCBot?

Der Crawler von Common Crawl erstellt einen offenen Web-Korpus, der häufig zum Trainieren von KI-Modellen verwendet wird. Er beachtet robots.txt.

- **robots.txt-Token**: `CCBot`
- **Betreiber**: Common Crawl
- **Zweck**: Training
- **Hält sich an robots.txt**: Der Betreiber gibt an, dass der Bot robots.txt beachtet.
- **Vom Betreiber dokumentiert**: Ja, auf den Seiten des Betreibers.
- **Veröffentlichte IP-Liste**: [index.commoncrawl.org/ccbot.json](https://index.commoncrawl.org/ccbot.json)
- **Dokumentation**: [commoncrawl.org](https://commoncrawl.org/ccbot)

Die Hosts lassen sich im Reverse-DNS auf *.crawl.commoncrawl.org zurückführen. Common Crawl veröffentlicht außerdem eine IP-Liste.

## CCBot für Ihre gesamte Website sperren

`robots.txt`

```
User-agent: CCBot
Disallow: /
```

## Zugriff erlauben, aber private Pfade ausschließen

`robots.txt`

```
User-agent: CCBot
Allow: /
Disallow: /admin/
```

[Im Generator zu robots.txt hinzufügen →](https://dotsagent.io/de/agent-ready/robots-txt)

## Quellen

1. [commoncrawl.org](https://commoncrawl.org/ccbot)/ccbot

Unabhängige Referenz für alle, die KI-Agenten entwickeln. Wir sind mit keinem der hier genannten Anbieter verbunden.

© 2026 DotsAgent · Fakten geprüft am 1. Oktober 2026
