dotsagent.io
Taal:Nederlands
Open je site · generator

robots.txt-generator voor AI-bots

Kies een beleid voor elke soort AI-bot, stel uitzonderingen in voor afzonderlijke crawlers en kopieer een bestand dat voldoet aan RFC 9309. Trainingsbots, zoekbots en fetchers die op verzoek van een gebruiker werken, gebruiken afzonderlijke tokens. Zo kun je de ene weigeren en de andere toelaten.

Begin met
Training

Als je deze bots blokkeert, geef je aan dat deze aanbieders je pagina's niet mogen gebruiken voor modeltraining. Je zoekresultaten blijven ongewijzigd.

Zoeken

Als je deze blokkeert, blokkeer je ook Googlebot en Applebot. Daardoor verdwijnt je site uit Google Search en uit de resultaten van Siri, Spotlight en Safari van Apple.

Ophalen door gebruikers

Deze halen een pagina op omdat iemand daarom heeft gevraagd. Verschillende beheerders zeggen dat robots.txt mogelijk niet voor hen geldt. Een blokkade is hier dus een verzoek, geen garantie.

Agents

Google-Agent negeert robots.txt doorgaans en de meeste browse-agents hebben helemaal geen token. In de praktijk verandert deze groep dus weinig.

Klik op een bot om de instelling van de groep om te keren.

Content-Signal
search
ai-input
ai-train

Content-Signal geeft aan hoe opgehaalde pagina's mogen worden gebruikt: search voor zoekresultaten, ai-input voor het genereren van AI-antwoorden en ai-train voor het trainen van modellen. Het is afkomstig uit het CC0-beleid van Cloudflare en geeft een voorkeur aan, maar blokkeert niets.

/robots.txt
# AI-crawlers geblokkeerd voor de hele site
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Toegestane AI-crawlers, privépaden uitgesloten
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Alle overige crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

robots.txt is vrijwillig. ChatGPT-User, Perplexity-User en andere fetchers die door gebruikers worden gestart, zeggen dat de regels mogelijk niet voor hen gelden. Sommige agents hebben helemaal geen token. Om een blokkade af te dwingen, kun je verzoeken vergelijken met gepubliceerde IP-lijsten of signatures en ze bij je firewall of WAF weigeren.

Bekijk alle bots in de directory →

Hoe het gegenereerde bestand werkt

Een crawler volgt zijn eigen groep

Een crawler die zijn token vindt in een User-agent-regel, volgt die groep en slaat de regels onder User-agent: * over. Daarom herhaalt de generator je privépaden voor bots die je bij naam toestaat en geeft hij geblokkeerde bots één Disallow: /.

Sommige tokens crawlen nooit

Google-Extended en Applebot-Extended hebben geen eigen user agent. Googlebot en Applebot halen de content op. De extended-tokens geven Google en Apple aan of die content hun modellen mag trainen; Google past Google-Extended ook toe op Gemini-grounding.

De meeste beheerders scheiden training en zoeken

OpenAI, Anthropic, Amazon en Mistral gebruiken elk aparte tokens voor training en zoeken. Met de preset No training blijf je dus beschikbaar in hun zoekproducten. Meta is de uitzondering: meta-externalagent wordt gebruikt voor zowel training als indexering.

Applebot valt terug op Googlebot

Als je bestand geen Applebot-groep bevat, volgt Applebot volgens Apple in plaats daarvan je Googlebot-regels. Applebot negeert ook Crawl-delay, net als Amazonbot, terwijl Anthropic zegt dat ClaudeBot deze instelling respecteert.

Vragen over robots.txt en AI-bots

Hoe blokkeer ik GPTBot zonder uit ChatGPT-zoekresultaten te verdwijnen?

Blokkeer GPTBot en laat OAI-SearchBot toe. GPTBot verzamelt trainingsdata, OAI-SearchBot indexeert pagina's voor ChatGPT-zoekresultaten en ChatGPT-User haalt pagina's op waar iemand om vraagt. OpenAI documenteert ze alle drie op één pagina, elk met een eigen IP-lijst.

Verdwijnt mijn site uit Google Search als ik Google-Extended blokkeer?

Google-Extended is een controletoken zonder eigen user agent; Googlebot voert de crawls uit. Als je Google-Extended blokkeert, geef je Google aan je content niet te gebruiken voor Gemini-training en -grounding. Je Googlebot-regels bepalen welke pagina's voor Search worden gecrawld.

Houden AI-crawlers zich aan Crawl-delay?

Sommige wel. Anthropic zegt dat ClaudeBot zich eraan houdt, terwijl Apple en Amazon zeggen dat Applebot en Amazonbot dat niet doen. Rate limiting op je server is de betrouwbaarste optie.

Waarom bezoekt ChatGPT-User mijn site nog steeds nadat ik het heb geblokkeerd?

OpenAI zegt dat de regels in robots.txt mogelijk niet gelden voor ChatGPT-User, omdat iemand om de pagina heeft gevraagd. Voor Perplexity-User, Amzn-User en meta-externalfetcher gelden vergelijkbare voorbehouden. Als de beheerder een IP-lijst publiceert, vergelijk verzoeken daarmee en blokkeer ze bij je firewall.

Wat doet Content-Signal in robots.txt?

Dit geeft aan hoe content na het ophalen mag worden gebruikt, via drie signalen: search, ai-input en ai-train, die elk op yes of no staan. Het geeft een voorkeur aan, maar blokkeert niets. Cloudflare's Markdown for Agents voegt standaard ai-train=yes, search=yes en ai-input=yes toe. Controleer dus de uitvoer als je die functie gebruikt.

Bronnen

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers

Onafhankelijke referentie voor iedereen die AI-agents bouwt. Niet verbonden aan een van de genoemde leveranciers.

© 2026 DotsAgent · Feiten gecontroleerd op 1 oktober 2026