dotsagent.io
Idioma:Português
Abra seu site · gerador

Gerador de robots.txt para bots de IA

Escolha uma política para cada tipo de bot de IA, defina exceções para crawlers específicos e copie um arquivo compatível com a RFC 9309. Bots de treinamento, busca e coleta acionada pelo usuário usam tokens separados, então você pode bloquear uns e permitir outros.

Começar com
Treinamento

Ao bloquear esses bots, você impede que esses operadores usem suas páginas para treinar modelos, sem afetar seus resultados de busca.

Busca

Bloquear esses bots também bloqueia Googlebot e Applebot, removendo seu site dos resultados da Pesquisa Google e da Siri, do Spotlight e do Safari da Apple.

Acesso do usuário

Esses bots buscam uma página porque alguém pediu, e vários operadores dizem que o robots.txt pode não se aplicar a eles. Portanto, bloqueá-los é um pedido, não uma garantia.

Agentes

Em geral, Google-Agent ignora o robots.txt, e a maioria dos agentes de navegação nem sequer tem um token. Por isso, na prática, este grupo pouco muda.

Clique em um bot para alternar sua configuração em relação à do grupo.

Content-Signal
search
ai-input
ai-train

Content-Signal indica como as páginas buscadas podem ser usadas: search para resultados de busca, ai-input para gerar respostas de IA e ai-train para treinar modelos. A política é da Cloudflare, publicada sob CC0, e expressa uma preferência sem bloquear nada.

/robots.txt
# Crawlers de IA bloqueados em todo o site
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Crawlers de IA permitidos; caminhos privados excluídos
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Todos os outros crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

O robots.txt é voluntário. ChatGPT-User, Perplexity-User e outros buscadores acionados por usuários dizem que as regras podem não se aplicar a eles, e alguns agentes nem sequer têm um token. Para aplicar um bloqueio, compare as requisições com listas de IPs ou assinaturas publicadas e negue o acesso no firewall ou WAF.

Veja todos os bots no diretório →

Como o arquivo gerado funciona

Cada crawler segue seu próprio grupo

Um crawler que encontra seu token em uma linha User-agent segue as regras desse grupo e ignora as regras em User-agent: *. Por isso, o gerador repete seus caminhos privados para os bots que você permite pelo nome e atribui um único Disallow: / aos bots bloqueados.

Alguns tokens não fazem crawling

Google-Extended e Applebot-Extended não têm user agent próprio. Googlebot e Applebot fazem as buscas, e os tokens estendidos informam ao Google e à Apple se o conteúdo pode ser usado para treinar seus modelos. O Google também aplica Google-Extended ao grounding do Gemini.

A maioria dos operadores separa treinamento e busca

OpenAI, Anthropic, Amazon e Mistral têm tokens separados para treinamento e busca. Assim, a predefinição Sem treinamento mantém seu conteúdo disponível nos produtos de busca dessas empresas. Meta é a exceção: meta-externalagent abrange tanto treinamento quanto indexação.

Applebot usa as regras do Googlebot como alternativa

Se o arquivo não tiver um grupo Applebot, a Apple diz que ele seguirá as regras do Googlebot. Applebot também ignora Crawl-delay, assim como Amazonbot, enquanto a Anthropic diz que ClaudeBot respeita essa diretiva.

Dúvidas sobre robots.txt e bots de IA

Como bloquear GPTBot sem deixar de aparecer na busca do ChatGPT?

Use Disallow para GPTBot e mantenha OAI-SearchBot permitido. GPTBot coleta dados para treinamento, OAI-SearchBot indexa páginas para a busca do ChatGPT, e ChatGPT-User faz buscas solicitadas por alguém. A OpenAI documenta os três em uma mesma página, cada um com sua própria lista de IPs.

Bloquear Google-Extended remove meu site da Pesquisa Google?

Google-Extended é um token de controle sem user agent próprio; quem faz o crawling é o Googlebot. Usar Disallow para esse token informa ao Google que seu conteúdo não deve ser usado no treinamento e no grounding do Gemini. As regras do Googlebot determinam o que é rastreado para a Pesquisa Google.

Os crawlers de IA respeitam Crawl-delay?

Alguns respeitam. A Anthropic diz que ClaudeBot respeita essa diretiva, enquanto Apple e Amazon dizem que Applebot e Amazonbot não. Limitar a taxa de requisições no servidor é a opção mais confiável.

Por que ChatGPT-User ainda acessa meu site depois que eu o bloqueei?

A OpenAI diz que as regras do robots.txt podem não se aplicar a ChatGPT-User, pois alguém solicitou a página. Perplexity-User, Amzn-User e meta-externalfetcher têm ressalvas semelhantes. Se o operador publicar uma lista de IPs, compare as requisições com ela e bloqueie o acesso no firewall.

O que Content-Signal faz no robots.txt?

Ele indica como o conteúdo pode ser usado depois de coletado, por meio de três sinais: search, ai-input e ai-train, cada um definido como yes ou no. Ele expressa uma preferência, mas não bloqueia nada. O Markdown for Agents da Cloudflare adiciona ai-train=yes, search=yes e ai-input=yes por padrão. Se você usar esse recurso, confira o resultado.

Fontes

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers

Referência independente para quem cria agentes de IA. Não temos vínculo com nenhum dos fornecedores mencionados aqui.

© 2026 DotsAgent · Fatos verificados em 1 de outubro de 2026