Diretório de crawlers e agentes de IA
Cada bot de IA que conseguimos confirmar, com o token usado em robots.txt, o que ele busca, se o operador afirma seguir as regras e como verificar se uma requisição realmente vem dele. Tokens conhecidos apenas pelo registro comunitário ai.robots.txt estão identificados nas respectivas páginas.
| Bot | Token | Finalidade | Segue robots.txt | Verificação |
|---|---|---|---|---|
| GPTBot | GPTBot | Treinamento | Sim | Lista de IPs |
| OAI-SearchBot | OAI-SearchBot | Busca | Sim | Lista de IPs |
| ChatGPT-User | ChatGPT-User | Acesso do usuário | Não | Lista de IPs |
| OAI-AdsBot | OAI-AdsBot | Anúncios | Não informado | Lista de IPs |
| ChatGPT agent | Sem token | Agentes | Não informado | Requisições assinadas |
| ClaudeBot | ClaudeBot | Treinamento | Sim | Lista de IPs |
| Claude-SearchBot | Claude-SearchBot | Busca | Sim | Lista de IPs |
| Claude-User | Claude-User | Acesso do usuário | Sim | Lista de IPs |
| Googlebot | Googlebot | Busca | Sim | Lista de IPs |
| Google-Extended | Google-Extended | Treinamento | Sim | — |
| Google-CloudVertexBot | Google-CloudVertexBot | Busca | Sim | Lista de IPs |
| GoogleOther | GoogleOther | Treinamento | Sim | Lista de IPs |
| Google-Agent | Google-Agent | Agentes | Não | Lista de IPs |
| Google-GeminiNotebook | Google-GeminiNotebook | Acesso do usuário | Não | Lista de IPs |
| Gemini Spark | Sem token | Agentes | Não informado | — |
| Gemini-Deep-Research | Gemini-Deep-Research | Acesso do usuário | Não informado | — |
| GoogleAgent-Mariner | GoogleAgent-Mariner | Agentes | Não informado | — |
| Applebot | Applebot | Busca | Sim | Lista de IPs |
| Applebot-Extended | Applebot-Extended | Treinamento | Sim | — |
| PerplexityBot | PerplexityBot | Busca | Sim | Lista de IPs |
| Perplexity-User | Perplexity-User | Acesso do usuário | Não | Lista de IPs |
| meta-externalagent | meta-externalagent | Treinamento | Sim | — |
| meta-webindexer | meta-webindexer | Busca | Sim | — |
| meta-externalfetcher | meta-externalfetcher | Acesso do usuário | Não | — |
| meta-externalads | meta-externalads | Anúncios | Sim | — |
| facebookexternalhit | facebookexternalhit | Acesso do usuário | Não | — |
| Muse | Sem token | Agentes | Não informado | — |
| Amazonbot | Amazonbot | Treinamento | Sim | Lista de IPs |
| Amzn-SearchBot | Amzn-SearchBot | Busca | Sim | Lista de IPs |
| Amzn-User | Amzn-User | Acesso do usuário | Não | Lista de IPs |
| DuckAssistBot | DuckAssistBot | Busca | Sim | Lista de IPs |
| MistralAI-User | MistralAI-User | Acesso do usuário | Sim | Lista de IPs |
| MistralAI-Index | MistralAI-Index | Busca | Sim | Lista de IPs |
| MistralAI-Training | MistralAI-Training | Treinamento | Sim | — |
| CCBot | CCBot | Treinamento | Sim | Lista de IPs |
| cohere-ai | cohere-ai | Acesso do usuário | Não informado | — |
| Bytespider | Bytespider | Treinamento | Não | — |
| YouBot | YouBot | Busca | Não informado | — |
| Diffbot | Diffbot | Busca | Não informado | — |
| Timpibot | Timpibot | Treinamento | Não informado | — |
O que significam as finalidades
- Treinamento
- Coleta páginas para treinar modelos ou fazer crawls de pesquisa geral. Google-Extended e Applebot-Extended são tokens de controle que não buscam conteúdo por conta própria.
- Busca
- Indexa páginas para um produto de busca, do Google Search a mecanismos de respostas com IA, como a busca do ChatGPT, Perplexity e DuckAssist. Bloquear um bot impede que suas páginas apareçam nesse produto.
- Acesso do usuário
- Busca uma página a pedido de alguém em um chat ou ferramenta. Vários operadores afirmam que robots.txt pode não se aplicar a essas requisições.
- Agentes
- Navega e realiza ações em nome do usuário, geralmente em um navegador completo. Muitos não têm token e só podem ser identificados por assinatura, se isso for possível.
- Anúncios
- Verifica páginas de destino de anúncios enviadas por anunciantes. Esses bots não são incluídos no gerador de robots.txt.
Verifique a identidade de um bot
É fácil falsificar uma string de user-agent. A maioria dos grandes operadores publica em arquivos JSON os intervalos de IP usados pelos seus bots, identificados como lista de IPs na tabela. Compare o endereço da requisição com a lista correspondente ao token e considere não verificada qualquer correspondência baseada apenas no nome.
Alguns operadores também documentam o DNS reverso. A Common Crawl, por exemplo, informa que os hosts do CCBot são resolvidos para *.crawl.commoncrawl.org; antes de confiar nessa informação, confirme que o hostname também é resolvido de volta para o mesmo endereço.
Cada vez mais, os agentes assinam requisições usando HTTP Message Signatures (RFC 9421), conforme o rascunho do Web Bot Auth. A requisição identifica o operador em Signature-Agent, e a verificação é feita com as chaves públicas disponíveis em /.well-known/http-message-signatures-directory no domínio correspondente. Uma assinatura válida comprova a identidade do operador, não a do usuário por trás da requisição nem o que esse usuário pode fazer.
Gerar um robots.txt com esta lista →
Dúvidas sobre rastreadores de IA
Quais rastreadores de IA ignoram o robots.txt?
Segundo a documentação dos próprios operadores, ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher e facebookexternalhit podem não seguir as regras, principalmente porque a busca é iniciada por um usuário. Segundo relatos da comunidade, o Bytespider não respeita essas regras.
Qual é a diferença entre GPTBot, OAI-SearchBot e ChatGPT-User?
O GPTBot coleta páginas para treinar modelos da OpenAI, o OAI-SearchBot indexa páginas para a busca do ChatGPT e o ChatGPT-User acessa uma página quando alguém solicita. Os dois primeiros seguem o robots.txt; a OpenAI informa que as regras talvez não se apliquem ao terceiro.
Quais agentes de IA não têm um token para robots.txt?
ChatGPT agent, Gemini Spark e Muse, da Meta. É possível verificar o ChatGPT agent pela assinatura Web Bot Auth de https://chatgpt.com. No modo local do Chrome, o Gemini Spark se parece com o navegador do próprio usuário, e a Muse não tem um user-agent publicado.
Como verificar se uma requisição realmente vem do Googlebot?
O Google publica os intervalos de IP do Googlebot em um arquivo JSON, vinculado à entrada correspondente neste diretório. Confira se o endereço da requisição está nesses intervalos, em vez de confiar na string de user-agent.
De onde vem esta lista de bots de IA?
Cada entrada inclui um link para a documentação do operador, quando disponível. Os tokens sem documentação vêm do registro comunitário ai.robots.txt. Não incluímos DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin e PetalBot porque não encontramos documentação dos operadores. A lista foi verificada em 1 October 2026.