---
title: "Gerador de robots.txt para crawlers e agentes de IA · DotsAgent"
description: "Crie um robots.txt que bloqueia o treinamento de IA sem impedir a busca: 35 tokens de bot agrupados por finalidade, linhas Content-Signal, caminhos privados e uma linha de sitemap."
url: https://dotsagent.io/pt/agent-ready/robots-txt
---

Abra seu site · gerador

# Gerador de robots.txt para bots de IA

Escolha uma política para cada tipo de bot de IA, defina exceções para crawlers específicos e copie um arquivo compatível com a RFC 9309. Bots de treinamento, busca e coleta acionada pelo usuário usam tokens separados, então você pode bloquear uns e permitir outros.

`/robots.txt`

```
# Crawlers de IA bloqueados em todo o site
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Crawlers de IA permitidos; caminhos privados excluídos
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Todos os outros crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml
```

O robots.txt é voluntário. ChatGPT-User, Perplexity-User e outros buscadores acionados por usuários dizem que as regras podem não se aplicar a eles, e alguns agentes nem sequer têm um token. Para aplicar um bloqueio, compare as requisições com listas de IPs ou assinaturas publicadas e negue o acesso no firewall ou WAF.

[Veja todos os bots no diretório →](https://dotsagent.io/pt/agent-ready/bots)

## Como o arquivo gerado funciona

### Cada crawler segue seu próprio grupo

Um crawler que encontra seu token em uma linha User-agent segue as regras desse grupo e ignora as regras em User-agent: *. Por isso, o gerador repete seus caminhos privados para os bots que você permite pelo nome e atribui um único Disallow: / aos bots bloqueados.

### Alguns tokens não fazem crawling

Google-Extended e Applebot-Extended não têm user agent próprio. Googlebot e Applebot fazem as buscas, e os tokens estendidos informam ao Google e à Apple se o conteúdo pode ser usado para treinar seus modelos. O Google também aplica Google-Extended ao grounding do Gemini.

### A maioria dos operadores separa treinamento e busca

OpenAI, Anthropic, Amazon e Mistral têm tokens separados para treinamento e busca. Assim, a predefinição Sem treinamento mantém seu conteúdo disponível nos produtos de busca dessas empresas. Meta é a exceção: meta-externalagent abrange tanto treinamento quanto indexação.

### Applebot usa as regras do Googlebot como alternativa

Se o arquivo não tiver um grupo Applebot, a Apple diz que ele seguirá as regras do Googlebot. Applebot também ignora Crawl-delay, assim como Amazonbot, enquanto a Anthropic diz que ClaudeBot respeita essa diretiva.

## Dúvidas sobre robots.txt e bots de IA

### Como bloquear GPTBot sem deixar de aparecer na busca do ChatGPT?

Use Disallow para GPTBot e mantenha OAI-SearchBot permitido. GPTBot coleta dados para treinamento, OAI-SearchBot indexa páginas para a busca do ChatGPT, e ChatGPT-User faz buscas solicitadas por alguém. A OpenAI documenta os três em uma mesma página, cada um com sua própria lista de IPs.

### Bloquear Google-Extended remove meu site da Pesquisa Google?

Google-Extended é um token de controle sem user agent próprio; quem faz o crawling é o Googlebot. Usar Disallow para esse token informa ao Google que seu conteúdo não deve ser usado no treinamento e no grounding do Gemini. As regras do Googlebot determinam o que é rastreado para a Pesquisa Google.

### Os crawlers de IA respeitam Crawl-delay?

Alguns respeitam. A Anthropic diz que ClaudeBot respeita essa diretiva, enquanto Apple e Amazon dizem que Applebot e Amazonbot não. Limitar a taxa de requisições no servidor é a opção mais confiável.

### Por que ChatGPT-User ainda acessa meu site depois que eu o bloqueei?

A OpenAI diz que as regras do robots.txt podem não se aplicar a ChatGPT-User, pois alguém solicitou a página. Perplexity-User, Amzn-User e meta-externalfetcher têm ressalvas semelhantes. Se o operador publicar uma lista de IPs, compare as requisições com ela e bloqueie o acesso no firewall.

### O que Content-Signal faz no robots.txt?

Ele indica como o conteúdo pode ser usado depois de coletado, por meio de três sinais: search, ai-input e ai-train, cada um definido como yes ou no. Ele expressa uma preferência, mas não bloqueia nada. O Markdown for Agents da Cloudflare adiciona ai-train=yes, search=yes e ai-input=yes por padrão. Se você usar esse recurso, confira o resultado.

## Fontes

1. [rfc-editor.org](https://www.rfc-editor.org/rfc/rfc9309)/rfc/rfc9309
2. [contentsignals.org](https://contentsignals.org/)/
3. [developers.google.com](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)/search/docs/crawling-indexing/google-common-crawlers

Referência independente para quem cria agentes de IA. Não temos vínculo com nenhum dos fornecedores mencionados aqui.

© 2026 DotsAgent · Fatos verificados em 1 de outubro de 2026
