robots.txt-generator voor AI-bots
Kies een beleid voor elke soort AI-bot, stel uitzonderingen in voor afzonderlijke crawlers en kopieer een bestand dat voldoet aan RFC 9309. Trainingsbots, zoekbots en fetchers die op verzoek van een gebruiker werken, gebruiken afzonderlijke tokens. Zo kun je de ene weigeren en de andere toelaten.
# AI-crawlers geblokkeerd voor de hele site
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /
# Toegestane AI-crawlers, privépaden uitgesloten
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/
# Alle overige crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml
robots.txt is vrijwillig. ChatGPT-User, Perplexity-User en andere fetchers die door gebruikers worden gestart, zeggen dat de regels mogelijk niet voor hen gelden. Sommige agents hebben helemaal geen token. Om een blokkade af te dwingen, kun je verzoeken vergelijken met gepubliceerde IP-lijsten of signatures en ze bij je firewall of WAF weigeren.
Hoe het gegenereerde bestand werkt
Een crawler volgt zijn eigen groep
Een crawler die zijn token vindt in een User-agent-regel, volgt die groep en slaat de regels onder User-agent: * over. Daarom herhaalt de generator je privépaden voor bots die je bij naam toestaat en geeft hij geblokkeerde bots één Disallow: /.
Sommige tokens crawlen nooit
Google-Extended en Applebot-Extended hebben geen eigen user agent. Googlebot en Applebot halen de content op. De extended-tokens geven Google en Apple aan of die content hun modellen mag trainen; Google past Google-Extended ook toe op Gemini-grounding.
De meeste beheerders scheiden training en zoeken
OpenAI, Anthropic, Amazon en Mistral gebruiken elk aparte tokens voor training en zoeken. Met de preset No training blijf je dus beschikbaar in hun zoekproducten. Meta is de uitzondering: meta-externalagent wordt gebruikt voor zowel training als indexering.
Applebot valt terug op Googlebot
Als je bestand geen Applebot-groep bevat, volgt Applebot volgens Apple in plaats daarvan je Googlebot-regels. Applebot negeert ook Crawl-delay, net als Amazonbot, terwijl Anthropic zegt dat ClaudeBot deze instelling respecteert.
Vragen over robots.txt en AI-bots
Hoe blokkeer ik GPTBot zonder uit ChatGPT-zoekresultaten te verdwijnen?
Blokkeer GPTBot en laat OAI-SearchBot toe. GPTBot verzamelt trainingsdata, OAI-SearchBot indexeert pagina's voor ChatGPT-zoekresultaten en ChatGPT-User haalt pagina's op waar iemand om vraagt. OpenAI documenteert ze alle drie op één pagina, elk met een eigen IP-lijst.
Verdwijnt mijn site uit Google Search als ik Google-Extended blokkeer?
Google-Extended is een controletoken zonder eigen user agent; Googlebot voert de crawls uit. Als je Google-Extended blokkeert, geef je Google aan je content niet te gebruiken voor Gemini-training en -grounding. Je Googlebot-regels bepalen welke pagina's voor Search worden gecrawld.
Houden AI-crawlers zich aan Crawl-delay?
Sommige wel. Anthropic zegt dat ClaudeBot zich eraan houdt, terwijl Apple en Amazon zeggen dat Applebot en Amazonbot dat niet doen. Rate limiting op je server is de betrouwbaarste optie.
Waarom bezoekt ChatGPT-User mijn site nog steeds nadat ik het heb geblokkeerd?
OpenAI zegt dat de regels in robots.txt mogelijk niet gelden voor ChatGPT-User, omdat iemand om de pagina heeft gevraagd. Voor Perplexity-User, Amzn-User en meta-externalfetcher gelden vergelijkbare voorbehouden. Als de beheerder een IP-lijst publiceert, vergelijk verzoeken daarmee en blokkeer ze bij je firewall.
Wat doet Content-Signal in robots.txt?
Dit geeft aan hoe content na het ophalen mag worden gebruikt, via drie signalen: search, ai-input en ai-train, die elk op yes of no staan. Het geeft een voorkeur aan, maar blokkeert niets. Cloudflare's Markdown for Agents voegt standaard ai-train=yes, search=yes en ai-input=yes toe. Controleer dus de uitvoer als je die functie gebruikt.