dotsagent.io
اللغة:العربية
افتح موقعك · أداة إنشاء

إنشاء robots.txt لروبوتات الذكاء الاصطناعي

اختر سياسة لكل نوع من روبوتات الذكاء الاصطناعي، وحدد استثناءات لبرامج زحف بعينها، ثم انسخ ملفًا متوافقًا مع RFC 9309. تستخدم برامج التدريب والبحث والجلب بطلب من المستخدم رموزًا منفصلة، ما يتيح لك منع إحداها والسماح لأخرى.

البدء من
التدريب

يؤدي حظر هذه البرامج إلى استبعاد صفحاتك من تدريب النماذج لدى هذه الجهات، مع إبقائها ضمن نتائج البحث.

البحث

حظر هذه البرامج يحظر أيضًا Googlebot وApplebot، ما يؤدي إلى استبعاد موقعك من نتائج Google Search ومن نتائج Siri وSpotlight وSafari من Apple.

جلب المستخدم

تجلب هذه البرامج الصفحة استجابةً لطلب شخص ما، ويقول عدد من مشغّليها إن قواعد robots.txt قد لا تنطبق عليها؛ لذا فالحظر هنا طلب وليس ضمانًا.

الوكلاء

يتجاهل Google-Agent ملف robots.txt عمومًا، ولا تملك معظم وكلاء التصفح أي token أصلًا، لذا لا تغيّر هذه المجموعة الكثير عمليًا.

انقر على روبوت لتبديل إعداد مجموعته.

Content-Signal
search
ai-input
ai-train

يحدّد Content-Signal كيفية استخدام الصفحات التي جرى جلبها: search لنتائج البحث، وai-input لإعداد إجابات الذكاء الاصطناعي، وai-train لتدريب النماذج. يستند هذا إلى سياسة CC0 من Cloudflare، ويعبّر عن تفضيل من دون حظر أي شيء.

/robots.txt
# برامج زحف الذكاء الاصطناعي المحظورة من الموقع بالكامل
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# برامج زحف الذكاء الاصطناعي المسموح بها، باستثناء المسارات الخاصة
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# جميع برامج الزحف الأخرى
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

ملف robots.txt طوعي. تقول ChatGPT-User وPerplexity-User وبرامج جلب أخرى تستجيب لطلب المستخدم إن القواعد قد لا تنطبق عليها، وبعض الوكلاء لا تملك token أصلًا. لفرض الحظر، طابِق الطلبات مع قوائم IP المنشورة أو التواقيع، وارفضها عند جدار الحماية أو WAF.

عرض جميع برامج الروبوت في الدليل →

آلية عمل الملف المُنشأ

يتبع برنامج الزحف مجموعته الخاصة

يتبع برنامج الزحف الذي يجد token الخاص به في سطر User-agent قواعد تلك المجموعة، ويتجاهل القواعد الواردة تحت User-agent: *. لذلك يكرّر المولّد مساراتك الخاصة لكل برنامج تسمح به بالاسم، ويضع للبرامج المحظورة قاعدة Disallow: / واحدة.

بعض الرموز لا تُستخدم للزحف مطلقًا

لا يملك Google-Extended وApplebot-Extended وكيل مستخدم خاصًا به. يتولى Googlebot وApplebot جلب المحتوى، بينما تحدد الرموز الإضافية لـ Google وApple ما إذا كان يجوز استخدام هذا المحتوى لتدريب نماذجهما؛ كما يطبّق Google قاعدة Google-Extended على grounding في Gemini.

يفصل معظم المشغّلين بين التدريب والبحث

تشغّل OpenAI وAnthropic وAmazon وMistral رموزًا منفصلة للتدريب والبحث، لذا يُبقيك إعداد «منع التدريب» ضمن منتجات البحث الخاصة بها. أما Meta فهي الاستثناء: إذ يغطي meta-externalagent التدريب والفهرسة معًا.

يستخدم Applebot قواعد Googlebot عند غياب قواعده

إذا لم يتضمن ملفك مجموعة Applebot، تقول Apple إن Applebot يتبع قواعد Googlebot بدلًا منها. كما يتجاهل Applebot توجيه Crawl-delay، وكذلك Amazonbot، بينما تقول Anthropic إن ClaudeBot يلتزم به.

أسئلة عن robots.txt وبرامج روبوت الذكاء الاصطناعي

كيف أحظر GPTBot وأبقى ضمن بحث ChatGPT؟

أضف GPTBot إلى Disallow واترك OAI-SearchBot مسموحًا. يجمع GPTBot بيانات التدريب، ويفهرس OAI-SearchBot الصفحات لبحث ChatGPT، بينما يتولى ChatGPT-User عمليات الجلب التي يطلبها الأشخاص. توثّق OpenAI البرامج الثلاثة في صفحة واحدة، ولكل منها قائمة IP خاصة بها.

هل يؤدي حظر Google-Extended إلى إزالة موقعي من Google Search؟

Google-Extended هو رمز تحكم لا يملك وكيل مستخدم خاصًا به؛ إذ يتولى Googlebot الزحف. ويُعلم حظره Google بعدم استخدام محتواك لتدريب Gemini أو grounding فيه، بينما تحدد قواعد Googlebot لديك ما يُزحف إليه لأغراض البحث.

هل تلتزم برامج زحف الذكاء الاصطناعي بتوجيه Crawl-delay؟

يلتزم بعضها به. تقول Anthropic إن ClaudeBot يلتزم به، بينما تقول Apple وAmazon إن Applebot وAmazonbot لا يلتزمان به. ويظل تحديد معدل الطلبات على خادمك الخيار الأكثر موثوقية.

لماذا يزورني ChatGPT-User رغم أنني حظرته؟

تقول OpenAI إن قواعد robots.txt قد لا تنطبق على ChatGPT-User، لأن شخصًا ما طلب الصفحة. وتنطبق تحفظات مشابهة على Perplexity-User وAmzn-User وmeta-externalfetcher. إذا نشر المشغّل قائمة IP، فطابِق الطلبات معها واحظرها عند جدار الحماية.

ما وظيفة Content-Signal في robots.txt؟

يوضح كيفية استخدام المحتوى بعد جلبه، عبر ثلاث إشارات: search وai-input وai-train، وتكون قيمة كل منها yes أو no. وهو يعبّر عن تفضيل ولا يحظر شيئًا. تضيف ميزة Markdown for Agents من Cloudflare افتراضيًا ai-train=yes وsearch=yes وai-input=yes، لذا تحقّق من مخرجاتها إذا استخدمت هذه الميزة.

المصادر

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers