Common Crawl · Trenowanie
Czym jest CCBot?
Crawler Common Crawl, który tworzy otwarty korpus sieci powszechnie wykorzystywany do trenowania modeli AI. Przestrzega robots.txt.
- Token robots.txt
CCBot- Operator
- Common Crawl
- Cel
- Trenowanie
- Przestrzega robots.txt
- Tak Operator informuje, że bot przestrzega robots.txt.
- Udokumentowany przez operatora
- Tak, na własnych stronach operatora.
- Opublikowana lista adresów IP
- index.commoncrawl.org/ccbot.json
- Dokumentacja
- commoncrawl.org
W reverse DNS jego hosty wskazują na *.crawl.commoncrawl.org, a Common Crawl publikuje listę adresów IP.
Zablokuj CCBot w całej witrynie
User-agent: CCBot
Disallow: /
Zezwól na dostęp, ale zablokuj ścieżki prywatne
User-agent: CCBot
Allow: /
Disallow: /admin/
Dodaj do robots.txt w generatorze →