dotsagent.io
اللغة:العربية
Common Crawl · التدريب

ما هو CCBot؟

زاحف Common Crawl، الذي ينشئ مجموعة مفتوحة من محتوى الويب تُستخدم على نطاق واسع لتدريب نماذج الذكاء الاصطناعي. يلتزم بـ robots.txt.

رمز robots.txt
CCBot
المشغّل
Common Crawl
الغرض
التدريب
يلتزم بـ robots.txt
نعم يذكر المشغّل أن هذا البوت يلتزم بملف robots.txt.
موثّق من المشغّل
نعم، في صفحات المشغّل نفسه.
قائمة IP منشورة
index.commoncrawl.org/ccbot.json
التوثيق
commoncrawl.org

تُحل أسماء مضيفاته في نظام DNS العكسي إلى *.crawl.commoncrawl.org، وتنشر Common Crawl قائمة بعناوين IP.

احظر CCBot من موقعك بالكامل

robots.txt
User-agent: CCBot
Disallow: /

اسمح له، مع حجب المسارات الخاصة

robots.txt
User-agent: CCBot
Allow: /
Disallow: /admin/

أضِفه إلى ملف robots.txt في المولّد →

المصادر

  1. commoncrawl.org/ccbot