dotsagent.io
Bahasa:Bahasa Indonesia
Buka situs Anda · generator

Generator robots.txt untuk bot AI

Pilih kebijakan untuk tiap jenis bot AI, atur pengecualian untuk crawler tertentu, lalu salin file yang sesuai dengan RFC 9309. Pelatihan, pencarian, dan pengambil konten atas permintaan pengguna menggunakan token yang berbeda, jadi Anda bisa menolak satu jenis dan mengizinkan jenis lainnya.

Mulai dari
Pelatihan

Dengan memblokir bot ini, Anda mengecualikan halaman dari pelatihan model oleh operator tersebut tanpa memengaruhi hasil pencarian.

Pencarian

Memblokir bot ini juga memblokir Googlebot dan Applebot, sehingga situs Anda tidak muncul di Google Search maupun hasil Siri, Spotlight, dan Safari dari Apple.

Pengambilan oleh pengguna

Bot ini mengambil halaman atas permintaan seseorang. Beberapa operator menyatakan bahwa robots.txt mungkin tidak berlaku, jadi pemblokiran di sini merupakan permintaan, bukan jaminan.

Agen

Google-Agent umumnya mengabaikan robots.txt dan sebagian besar agen penjelajah tidak memiliki token sama sekali, jadi grup ini tidak banyak berpengaruh dalam praktiknya.

Ketuk bot untuk membalik statusnya dibandingkan dengan setelan grup.

Content-Signal
search
ai-input
ai-train

Content-Signal menyatakan cara halaman yang diambil boleh digunakan: search untuk hasil pencarian, ai-input untuk menghasilkan jawaban AI, dan ai-train untuk melatih model. Kebijakan ini berasal dari Cloudflare dan berlisensi CC0. Content-Signal menyatakan preferensi tanpa memblokir apa pun.

/robots.txt
# Crawler AI yang diblokir dari seluruh situs
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Crawler AI yang diizinkan, tidak termasuk path privat
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Semua crawler lainnya
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

robots.txt bersifat sukarela. ChatGPT-User, Perplexity-User, dan pengambil halaman lain yang dipicu pengguna menyatakan bahwa aturan ini mungkin tidak berlaku bagi mereka, dan beberapa agen sama sekali tidak memiliki token. Untuk memastikan pemblokiran, cocokkan permintaan dengan daftar IP atau signature yang dipublikasikan, lalu tolak permintaan tersebut di firewall atau WAF.

Lihat semua bot di direktori →

Cara kerja file yang dihasilkan

Crawler mengikuti grupnya sendiri

Crawler yang menemukan tokennya di baris User-agent akan mengikuti grup tersebut dan mengabaikan aturan di bawah User-agent: *. Karena itu, generator mengulang path privat untuk bot yang Anda izinkan berdasarkan namanya, dan memberikan satu Disallow: / untuk bot yang diblokir.

Sebagian token tidak melakukan crawling

Google-Extended dan Applebot-Extended tidak memiliki user agent sendiri. Googlebot dan Applebot yang mengambil halaman, sedangkan token extended memberi tahu Google dan Apple apakah konten tersebut boleh digunakan untuk melatih model mereka. Google juga menerapkan Google-Extended untuk grounding Gemini.

Sebagian besar operator memisahkan pelatihan dan pencarian

OpenAI, Anthropic, Amazon, dan Mistral masing-masing menggunakan token terpisah untuk pelatihan dan pencarian, sehingga preset Tanpa pelatihan tetap memungkinkan Anda muncul di produk pencarian mereka. Meta menjadi pengecualian: meta-externalagent mencakup pelatihan dan pengindeksan.

Applebot menggunakan aturan Googlebot jika tidak ada aturan khusus

Jika file Anda tidak memiliki grup Applebot, Apple menyatakan bahwa Applebot akan mengikuti aturan Googlebot. Applebot juga mengabaikan Crawl-delay, begitu pula Amazonbot, sedangkan Anthropic menyatakan bahwa ClaudeBot mematuhinya.

Pertanyaan tentang robots.txt dan bot AI

Bagaimana cara memblokir GPTBot tetapi tetap muncul di pencarian ChatGPT?

Tambahkan Disallow untuk GPTBot dan biarkan OAI-SearchBot tetap diizinkan. GPTBot mengumpulkan data pelatihan, OAI-SearchBot mengindeks halaman untuk pencarian ChatGPT, dan ChatGPT-User menangani pengambilan halaman atas permintaan seseorang. OpenAI mendokumentasikan ketiganya di satu halaman, masing-masing dengan daftar IP sendiri.

Apakah memblokir Google-Extended akan menghapus situs saya dari Google Search?

Google-Extended adalah token kontrol yang tidak memiliki user agent sendiri; Googlebot yang melakukan crawling. Menambahkan Disallow untuknya memberi tahu Google agar tidak menggunakan konten Anda untuk pelatihan dan grounding Gemini, sedangkan aturan Googlebot menentukan halaman yang di-crawl untuk Search.

Apakah crawler AI mematuhi Crawl-delay?

Sebagian mematuhinya. Anthropic menyatakan bahwa ClaudeBot mematuhi Crawl-delay, sedangkan Apple dan Amazon menyatakan bahwa Applebot dan Amazonbot tidak mematuhinya. Pembatasan laju di server Anda adalah opsi yang dapat diandalkan.

Mengapa ChatGPT-User masih mengunjungi situs saya setelah saya memblokirnya?

OpenAI menyatakan bahwa aturan robots.txt mungkin tidak berlaku untuk ChatGPT-User karena halaman tersebut diminta oleh seseorang. Perplexity-User, Amzn-User, dan meta-externalfetcher memiliki pengecualian serupa. Jika operator memublikasikan daftar IP, cocokkan permintaan dengan daftar tersebut dan blokirnya di firewall.

Apa fungsi Content-Signal di robots.txt?

Ini menyatakan bagaimana konten boleh digunakan setelah diambil, melalui tiga sinyal: search, ai-input, dan ai-train, yang masing-masing bernilai yes atau no. Sinyal ini menyatakan preferensi dan tidak memblokir apa pun. Markdown for Agents dari Cloudflare menambahkan ai-train=yes, search=yes, ai-input=yes secara default. Jadi, periksa hasilnya jika Anda menggunakan fitur tersebut.

Sumber

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers

Referensi independen bagi mereka yang membangun agen AI. Tidak berafiliasi dengan vendor mana pun yang disebutkan di sini.

© 2026 DotsAgent · Fakta diperiksa 1 Oktober 2026