dotsagent.io
Wika:Filipino
Buksan ang site mo · generator

Gumawa ng robots.txt para sa mga AI bot

Pumili ng policy para sa bawat uri ng AI bot, magtakda ng eksepsiyon para sa mga indibidwal na crawler, at kopyahin ang file na sumusunod sa RFC 9309. Magkakahiwalay ang mga token para sa training, search, at mga fetcher na pinasimulan ng user, kaya maaari mong harangan ang isa at payagan ang iba.

Magsimula sa
Pagsasanay

Kapag hinarangan mo ang mga ito, hindi magagamit ng mga operator na ito ang mga page mo para sa model training, pero hindi maaapektuhan ang mga listing mo sa search.

Paghahanap

Kapag bina-block ang mga ito, bina-block din ang Googlebot at Applebot, kaya hindi na lalabas ang site mo sa Google Search at sa mga resulta ng Siri, Spotlight at Safari ng Apple.

Mga pagkuha ng user

Kumukuha ang mga ito ng page kapag may taong humiling nito. Sinasabi ng ilang operator na maaaring hindi naaangkop sa kanila ang robots.txt, kaya kahilingan lang at hindi garantiya ang pag-block dito.

Mga agent

Karaniwang hindi pinapansin ng Google-Agent ang robots.txt, at walang token ang karamihan sa mga browsing agent, kaya kaunti lang ang epekto ng grupong ito sa aktuwal na paggamit.

I-tap ang bot para baligtarin ang setting nito kumpara sa setting ng grupo.

Content-Signal
search
ai-input
ai-train

Itinatakda ng Content-Signal kung paano maaaring gamitin ang mga kinuhang page: search para sa mga resulta ng paghahanap, ai-input para sa pagbuo ng mga sagot ng AI, at ai-train para sa pagsasanay ng mga model. Nagmula ito sa patakarang CC0 ng Cloudflare at nagsasaad ng kagustuhan nang walang bina-block.

/robots.txt
# Mga AI crawler na naka-block sa buong site
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Mga pinapayagang AI crawler; hindi kasama ang mga pribadong path
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Lahat ng iba pang crawler
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

Boluntaryo ang robots.txt. Sinasabi ng ChatGPT-User, Perplexity-User at iba pang fetcher na na-trigger ng user na maaaring hindi naaangkop sa kanila ang mga panuntunan, at walang token ang ilang agent. Para matiyak ang pag-block, itugma ang mga request sa mga inilathalang IP list o signature at tanggihan ang mga ito sa firewall o WAF mo.

Tingnan ang lahat ng bot sa directory →

Paano gumagana ang nabuong file

Sariling grupo ang sinusunod ng bawat crawler

Kapag nakita ng crawler ang token nito sa linya ng User-agent, susundin nito ang grupong iyon at lalaktawan ang mga panuntunan sa ilalim ng User-agent: *. Kaya inuulit ng generator ang mga pribadong path para sa mga bot na pinapayagan mo ayon sa pangalan, at iisang Disallow: / lang ang itinatakda nito para sa mga naka-block na bot.

May mga token na hindi kailanman nagka-crawl

Walang sariling user agent ang Google-Extended at Applebot-Extended. Googlebot at Applebot ang kumukuha ng content, at sinasabi ng mga extended token sa Google at Apple kung maaari nilang gamitin ang content na iyon para sanayin ang mga model nila; ginagamit din ng Google ang Google-Extended para sa Gemini grounding.

Magkahiwalay ang training at search para sa karamihan ng operator

Magkakahiwalay ang token na ginagamit ng OpenAI, Anthropic, Amazon at Mistral para sa training at search, kaya mananatili ka sa mga search product nila kapag pinili mo ang No training. Eksepsiyon ang Meta: saklaw ng meta-externalagent ang training at indexing.

Gumagamit ang Applebot ng mga panuntunan ng Googlebot kung walang sariling grupo

Kung walang Applebot group sa file mo, sinasabi ng Apple na susundin ng Applebot ang mga panuntunan mo para sa Googlebot. Hindi rin pinapansin ng Applebot ang Crawl-delay, gayundin ng Amazonbot, samantalang sinasabi ng Anthropic na sinusunod ito ng ClaudeBot.

Mga tanong tungkol sa robots.txt at mga AI bot

Paano i-block ang GPTBot habang nananatili sa ChatGPT search?

Ilagay sa Disallow ang GPTBot at hayaang payagan ang OAI-SearchBot. Kumokolekta ang GPTBot ng data para sa training, ini-index ng OAI-SearchBot ang mga page para sa ChatGPT search, at humahawak naman ang ChatGPT-User sa mga pagkuha ng page na hiniling ng isang tao. Inilalarawan ng OpenAI ang tatlo sa iisang page, at may sarili silang IP list bawat isa.

Matatanggal ba sa Google Search ang site ko kapag bina-block ko ang Google-Extended?

Control token ang Google-Extended at wala itong sariling user agent; Googlebot ang gumagawa ng pag-crawl. Kapag inilagay mo ito sa Disallow, sinasabi mo sa Google na huwag gamitin ang content mo para sa Gemini training at grounding. Ang mga panuntunan mo para sa Googlebot naman ang nagtatakda kung ano ang ika-crawl para sa Search.

Sinusunod ba ng mga AI crawler ang Crawl-delay?

May ilan na sumusunod. Sinasabi ng Anthropic na sinusunod ito ng ClaudeBot, samantalang sinasabi ng Apple at Amazon na hindi ito sinusunod ng Applebot at Amazonbot. Mas maaasahan ang paglalagay ng rate limit sa server mo.

Bakit binibisita pa rin ng ChatGPT-User ang site ko kahit bina-block ko ito?

Sinasabi ng OpenAI na maaaring hindi naaangkop ang mga panuntunan ng robots.txt sa ChatGPT-User dahil may taong humiling ng page. May katulad na paalala para sa Perplexity-User, Amzn-User at meta-externalfetcher. Kung naglalathala ang operator ng IP list, itugma rito ang mga request at i-block ang mga ito sa firewall mo.

Ano ang ginagawa ng Content-Signal sa robots.txt?

Itinatakda nito kung paano maaaring gamitin ang content pagkatapos itong makuha, gamit ang tatlong signal: search, ai-input at ai-train, na bawat isa ay itinatakda sa yes o no. Ipinapahayag nito ang isang kagustuhan at wala itong hinaharang. Bilang default, itinatakda ng Markdown for Agents ng Cloudflare ang ai-train=yes, search=yes at ai-input=yes, kaya suriin ang output nito kung gagamitin mo ang feature na iyon.

Mga source

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers

Independent na sanggunian para sa mga gumagawa ng AI agent. Hindi kami kaanib ng alinman sa mga vendor na nakalista rito.

© 2026 DotsAgent · Sinuri ang mga detalye noong Oktubre 1, 2026