Gerador de robots.txt para bots de IA
Escolha uma política para cada tipo de bot de IA, defina exceções para crawlers específicos e copie um arquivo compatível com a RFC 9309. Bots de treinamento, busca e coleta acionada pelo usuário usam tokens separados, então você pode bloquear uns e permitir outros.
# Crawlers de IA bloqueados em todo o site
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /
# Crawlers de IA permitidos; caminhos privados excluídos
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/
# Todos os outros crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml
O robots.txt é voluntário. ChatGPT-User, Perplexity-User e outros buscadores acionados por usuários dizem que as regras podem não se aplicar a eles, e alguns agentes nem sequer têm um token. Para aplicar um bloqueio, compare as requisições com listas de IPs ou assinaturas publicadas e negue o acesso no firewall ou WAF.
Como o arquivo gerado funciona
Cada crawler segue seu próprio grupo
Um crawler que encontra seu token em uma linha User-agent segue as regras desse grupo e ignora as regras em User-agent: *. Por isso, o gerador repete seus caminhos privados para os bots que você permite pelo nome e atribui um único Disallow: / aos bots bloqueados.
Alguns tokens não fazem crawling
Google-Extended e Applebot-Extended não têm user agent próprio. Googlebot e Applebot fazem as buscas, e os tokens estendidos informam ao Google e à Apple se o conteúdo pode ser usado para treinar seus modelos. O Google também aplica Google-Extended ao grounding do Gemini.
A maioria dos operadores separa treinamento e busca
OpenAI, Anthropic, Amazon e Mistral têm tokens separados para treinamento e busca. Assim, a predefinição Sem treinamento mantém seu conteúdo disponível nos produtos de busca dessas empresas. Meta é a exceção: meta-externalagent abrange tanto treinamento quanto indexação.
Applebot usa as regras do Googlebot como alternativa
Se o arquivo não tiver um grupo Applebot, a Apple diz que ele seguirá as regras do Googlebot. Applebot também ignora Crawl-delay, assim como Amazonbot, enquanto a Anthropic diz que ClaudeBot respeita essa diretiva.
Dúvidas sobre robots.txt e bots de IA
Como bloquear GPTBot sem deixar de aparecer na busca do ChatGPT?
Use Disallow para GPTBot e mantenha OAI-SearchBot permitido. GPTBot coleta dados para treinamento, OAI-SearchBot indexa páginas para a busca do ChatGPT, e ChatGPT-User faz buscas solicitadas por alguém. A OpenAI documenta os três em uma mesma página, cada um com sua própria lista de IPs.
Bloquear Google-Extended remove meu site da Pesquisa Google?
Google-Extended é um token de controle sem user agent próprio; quem faz o crawling é o Googlebot. Usar Disallow para esse token informa ao Google que seu conteúdo não deve ser usado no treinamento e no grounding do Gemini. As regras do Googlebot determinam o que é rastreado para a Pesquisa Google.
Os crawlers de IA respeitam Crawl-delay?
Alguns respeitam. A Anthropic diz que ClaudeBot respeita essa diretiva, enquanto Apple e Amazon dizem que Applebot e Amazonbot não. Limitar a taxa de requisições no servidor é a opção mais confiável.
Por que ChatGPT-User ainda acessa meu site depois que eu o bloqueei?
A OpenAI diz que as regras do robots.txt podem não se aplicar a ChatGPT-User, pois alguém solicitou a página. Perplexity-User, Amzn-User e meta-externalfetcher têm ressalvas semelhantes. Se o operador publicar uma lista de IPs, compare as requisições com ela e bloqueie o acesso no firewall.
O que Content-Signal faz no robots.txt?
Ele indica como o conteúdo pode ser usado depois de coletado, por meio de três sinais: search, ai-input e ai-train, cada um definido como yes ou no. Ele expressa uma preferência, mas não bloqueia nada. O Markdown for Agents da Cloudflare adiciona ai-train=yes, search=yes e ai-input=yes por padrão. Se você usar esse recurso, confira o resultado.