Gumawa ng robots.txt para sa mga AI bot
Pumili ng policy para sa bawat uri ng AI bot, magtakda ng eksepsiyon para sa mga indibidwal na crawler, at kopyahin ang file na sumusunod sa RFC 9309. Magkakahiwalay ang mga token para sa training, search, at mga fetcher na pinasimulan ng user, kaya maaari mong harangan ang isa at payagan ang iba.
# Mga AI crawler na naka-block sa buong site
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /
# Mga pinapayagang AI crawler; hindi kasama ang mga pribadong path
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/
# Lahat ng iba pang crawler
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml
Boluntaryo ang robots.txt. Sinasabi ng ChatGPT-User, Perplexity-User at iba pang fetcher na na-trigger ng user na maaaring hindi naaangkop sa kanila ang mga panuntunan, at walang token ang ilang agent. Para matiyak ang pag-block, itugma ang mga request sa mga inilathalang IP list o signature at tanggihan ang mga ito sa firewall o WAF mo.
Paano gumagana ang nabuong file
Sariling grupo ang sinusunod ng bawat crawler
Kapag nakita ng crawler ang token nito sa linya ng User-agent, susundin nito ang grupong iyon at lalaktawan ang mga panuntunan sa ilalim ng User-agent: *. Kaya inuulit ng generator ang mga pribadong path para sa mga bot na pinapayagan mo ayon sa pangalan, at iisang Disallow: / lang ang itinatakda nito para sa mga naka-block na bot.
May mga token na hindi kailanman nagka-crawl
Walang sariling user agent ang Google-Extended at Applebot-Extended. Googlebot at Applebot ang kumukuha ng content, at sinasabi ng mga extended token sa Google at Apple kung maaari nilang gamitin ang content na iyon para sanayin ang mga model nila; ginagamit din ng Google ang Google-Extended para sa Gemini grounding.
Magkahiwalay ang training at search para sa karamihan ng operator
Magkakahiwalay ang token na ginagamit ng OpenAI, Anthropic, Amazon at Mistral para sa training at search, kaya mananatili ka sa mga search product nila kapag pinili mo ang No training. Eksepsiyon ang Meta: saklaw ng meta-externalagent ang training at indexing.
Gumagamit ang Applebot ng mga panuntunan ng Googlebot kung walang sariling grupo
Kung walang Applebot group sa file mo, sinasabi ng Apple na susundin ng Applebot ang mga panuntunan mo para sa Googlebot. Hindi rin pinapansin ng Applebot ang Crawl-delay, gayundin ng Amazonbot, samantalang sinasabi ng Anthropic na sinusunod ito ng ClaudeBot.
Mga tanong tungkol sa robots.txt at mga AI bot
Paano i-block ang GPTBot habang nananatili sa ChatGPT search?
Ilagay sa Disallow ang GPTBot at hayaang payagan ang OAI-SearchBot. Kumokolekta ang GPTBot ng data para sa training, ini-index ng OAI-SearchBot ang mga page para sa ChatGPT search, at humahawak naman ang ChatGPT-User sa mga pagkuha ng page na hiniling ng isang tao. Inilalarawan ng OpenAI ang tatlo sa iisang page, at may sarili silang IP list bawat isa.
Matatanggal ba sa Google Search ang site ko kapag bina-block ko ang Google-Extended?
Control token ang Google-Extended at wala itong sariling user agent; Googlebot ang gumagawa ng pag-crawl. Kapag inilagay mo ito sa Disallow, sinasabi mo sa Google na huwag gamitin ang content mo para sa Gemini training at grounding. Ang mga panuntunan mo para sa Googlebot naman ang nagtatakda kung ano ang ika-crawl para sa Search.
Sinusunod ba ng mga AI crawler ang Crawl-delay?
May ilan na sumusunod. Sinasabi ng Anthropic na sinusunod ito ng ClaudeBot, samantalang sinasabi ng Apple at Amazon na hindi ito sinusunod ng Applebot at Amazonbot. Mas maaasahan ang paglalagay ng rate limit sa server mo.
Bakit binibisita pa rin ng ChatGPT-User ang site ko kahit bina-block ko ito?
Sinasabi ng OpenAI na maaaring hindi naaangkop ang mga panuntunan ng robots.txt sa ChatGPT-User dahil may taong humiling ng page. May katulad na paalala para sa Perplexity-User, Amzn-User at meta-externalfetcher. Kung naglalathala ang operator ng IP list, itugma rito ang mga request at i-block ang mga ito sa firewall mo.
Ano ang ginagawa ng Content-Signal sa robots.txt?
Itinatakda nito kung paano maaaring gamitin ang content pagkatapos itong makuha, gamit ang tatlong signal: search, ai-input at ai-train, na bawat isa ay itinatakda sa yes o no. Ipinapahayag nito ang isang kagustuhan at wala itong hinaharang. Bilang default, itinatakda ng Markdown for Agents ng Cloudflare ang ai-train=yes, search=yes at ai-input=yes, kaya suriin ang output nito kung gagamitin mo ang feature na iyon.