Common Crawl · Training
Was ist CCBot?
Der Crawler von Common Crawl erstellt einen offenen Web-Korpus, der häufig zum Trainieren von KI-Modellen verwendet wird. Er beachtet robots.txt.
- robots.txt-Token
CCBot- Betreiber
- Common Crawl
- Zweck
- Training
- Hält sich an robots.txt
- Ja Der Betreiber gibt an, dass der Bot robots.txt beachtet.
- Vom Betreiber dokumentiert
- Ja, auf den Seiten des Betreibers.
- Veröffentlichte IP-Liste
- index.commoncrawl.org/ccbot.json
- Dokumentation
- commoncrawl.org
Die Hosts lassen sich im Reverse-DNS auf *.crawl.commoncrawl.org zurückführen. Common Crawl veröffentlicht außerdem eine IP-Liste.
CCBot für Ihre gesamte Website sperren
User-agent: CCBot
Disallow: /
Zugriff erlauben, aber private Pfade ausschließen
User-agent: CCBot
Allow: /
Disallow: /admin/
Im Generator zu robots.txt hinzufügen →