dotsagent.io
Sprache:Deutsch
Common Crawl · Training

Was ist CCBot?

Der Crawler von Common Crawl erstellt einen offenen Web-Korpus, der häufig zum Trainieren von KI-Modellen verwendet wird. Er beachtet robots.txt.

robots.txt-Token
CCBot
Betreiber
Common Crawl
Zweck
Training
Hält sich an robots.txt
Ja Der Betreiber gibt an, dass der Bot robots.txt beachtet.
Vom Betreiber dokumentiert
Ja, auf den Seiten des Betreibers.
Veröffentlichte IP-Liste
index.commoncrawl.org/ccbot.json
Dokumentation
commoncrawl.org

Die Hosts lassen sich im Reverse-DNS auf *.crawl.commoncrawl.org zurückführen. Common Crawl veröffentlicht außerdem eine IP-Liste.

CCBot für Ihre gesamte Website sperren

robots.txt
User-agent: CCBot
Disallow: /

Zugriff erlauben, aber private Pfade ausschließen

robots.txt
User-agent: CCBot
Allow: /
Disallow: /admin/

Im Generator zu robots.txt hinzufügen →

Quellen

  1. commoncrawl.org/ccbot