dotsagent.io
Idioma:Português
40 crawlers e agentes

Diretório de crawlers e agentes de IA

Cada bot de IA que conseguimos confirmar, com o token usado em robots.txt, o que ele busca, se o operador afirma seguir as regras e como verificar se uma requisição realmente vem dele. Tokens conhecidos apenas pelo registro comunitário ai.robots.txt estão identificados nas respectivas páginas.

BotTokenFinalidadeSegue robots.txtVerificação
GPTBot
OpenAI
GPTBotTreinamentoSimLista de IPs
OAI-SearchBot
OpenAI
OAI-SearchBotBuscaSimLista de IPs
ChatGPT-User
OpenAI
ChatGPT-UserAcesso do usuárioNãoLista de IPs
OAI-AdsBot
OpenAI
OAI-AdsBotAnúnciosNão informadoLista de IPs
ChatGPT agent
OpenAI
Sem tokenAgentesNão informadoRequisições assinadas
ClaudeBot
Anthropic
ClaudeBotTreinamentoSimLista de IPs
Claude-SearchBot
Anthropic
Claude-SearchBotBuscaSimLista de IPs
Claude-User
Anthropic
Claude-UserAcesso do usuárioSimLista de IPs
Googlebot
Google
GooglebotBuscaSimLista de IPs
Google-Extended
Google
Google-ExtendedTreinamentoSim—
Google-CloudVertexBot
Google
Google-CloudVertexBotBuscaSimLista de IPs
GoogleOther
Google
GoogleOtherTreinamentoSimLista de IPs
Google-Agent
Google
Google-AgentAgentesNãoLista de IPs
Google-GeminiNotebook
Google
Google-GeminiNotebookAcesso do usuárioNãoLista de IPs
Gemini Spark
Google
Sem tokenAgentesNão informado—
Gemini-Deep-Research
Google
Gemini-Deep-ResearchAcesso do usuárioNão informado—
GoogleAgent-Mariner
Google
GoogleAgent-MarinerAgentesNão informado—
Applebot
Apple
ApplebotBuscaSimLista de IPs
Applebot-Extended
Apple
Applebot-ExtendedTreinamentoSim—
PerplexityBot
Perplexity
PerplexityBotBuscaSimLista de IPs
Perplexity-User
Perplexity
Perplexity-UserAcesso do usuárioNãoLista de IPs
meta-externalagent
Meta
meta-externalagentTreinamentoSim—
meta-webindexer
Meta
meta-webindexerBuscaSim—
meta-externalfetcher
Meta
meta-externalfetcherAcesso do usuárioNão—
meta-externalads
Meta
meta-externaladsAnúnciosSim—
facebookexternalhit
Meta
facebookexternalhitAcesso do usuárioNão—
Muse
Meta
Sem tokenAgentesNão informado—
Amazonbot
Amazon
AmazonbotTreinamentoSimLista de IPs
Amzn-SearchBot
Amazon
Amzn-SearchBotBuscaSimLista de IPs
Amzn-User
Amazon
Amzn-UserAcesso do usuárioNãoLista de IPs
DuckAssistBot
DuckDuckGo
DuckAssistBotBuscaSimLista de IPs
MistralAI-User
Mistral
MistralAI-UserAcesso do usuárioSimLista de IPs
MistralAI-Index
Mistral
MistralAI-IndexBuscaSimLista de IPs
MistralAI-Training
Mistral
MistralAI-TrainingTreinamentoSim—
CCBot
Common Crawl
CCBotTreinamentoSimLista de IPs
cohere-ai
Cohere
cohere-aiAcesso do usuárioNão informado—
Bytespider
ByteDance
BytespiderTreinamentoNão—
YouBot
You.com
YouBotBuscaNão informado—
Diffbot
Diffbot
DiffbotBuscaNão informado—
Timpibot
Timpi
TimpibotTreinamentoNão informado—

O que significam as finalidades

Treinamento
Coleta páginas para treinar modelos ou fazer crawls de pesquisa geral. Google-Extended e Applebot-Extended são tokens de controle que não buscam conteúdo por conta própria.
Busca
Indexa páginas para um produto de busca, do Google Search a mecanismos de respostas com IA, como a busca do ChatGPT, Perplexity e DuckAssist. Bloquear um bot impede que suas páginas apareçam nesse produto.
Acesso do usuário
Busca uma página a pedido de alguém em um chat ou ferramenta. Vários operadores afirmam que robots.txt pode não se aplicar a essas requisições.
Agentes
Navega e realiza ações em nome do usuário, geralmente em um navegador completo. Muitos não têm token e só podem ser identificados por assinatura, se isso for possível.
Anúncios
Verifica páginas de destino de anúncios enviadas por anunciantes. Esses bots não são incluídos no gerador de robots.txt.

Verifique a identidade de um bot

É fácil falsificar uma string de user-agent. A maioria dos grandes operadores publica em arquivos JSON os intervalos de IP usados pelos seus bots, identificados como lista de IPs na tabela. Compare o endereço da requisição com a lista correspondente ao token e considere não verificada qualquer correspondência baseada apenas no nome.

Alguns operadores também documentam o DNS reverso. A Common Crawl, por exemplo, informa que os hosts do CCBot são resolvidos para *.crawl.commoncrawl.org; antes de confiar nessa informação, confirme que o hostname também é resolvido de volta para o mesmo endereço.

Cada vez mais, os agentes assinam requisições usando HTTP Message Signatures (RFC 9421), conforme o rascunho do Web Bot Auth. A requisição identifica o operador em Signature-Agent, e a verificação é feita com as chaves públicas disponíveis em /.well-known/http-message-signatures-directory no domínio correspondente. Uma assinatura válida comprova a identidade do operador, não a do usuário por trás da requisição nem o que esse usuário pode fazer.

Gerar um robots.txt com esta lista →

Dúvidas sobre rastreadores de IA

Quais rastreadores de IA ignoram o robots.txt?

Segundo a documentação dos próprios operadores, ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher e facebookexternalhit podem não seguir as regras, principalmente porque a busca é iniciada por um usuário. Segundo relatos da comunidade, o Bytespider não respeita essas regras.

Qual é a diferença entre GPTBot, OAI-SearchBot e ChatGPT-User?

O GPTBot coleta páginas para treinar modelos da OpenAI, o OAI-SearchBot indexa páginas para a busca do ChatGPT e o ChatGPT-User acessa uma página quando alguém solicita. Os dois primeiros seguem o robots.txt; a OpenAI informa que as regras talvez não se apliquem ao terceiro.

Quais agentes de IA não têm um token para robots.txt?

ChatGPT agent, Gemini Spark e Muse, da Meta. É possível verificar o ChatGPT agent pela assinatura Web Bot Auth de https://chatgpt.com. No modo local do Chrome, o Gemini Spark se parece com o navegador do próprio usuário, e a Muse não tem um user-agent publicado.

Como verificar se uma requisição realmente vem do Googlebot?

O Google publica os intervalos de IP do Googlebot em um arquivo JSON, vinculado à entrada correspondente neste diretório. Confira se o endereço da requisição está nesses intervalos, em vez de confiar na string de user-agent.

De onde vem esta lista de bots de IA?

Cada entrada inclui um link para a documentação do operador, quando disponível. Os tokens sem documentação vêm do registro comunitário ai.robots.txt. Não incluímos DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin e PetalBot porque não encontramos documentação dos operadores. A lista foi verificada em 1 October 2026.

Referência independente para quem cria agentes de IA. Não temos vínculo com nenhum dos fornecedores mencionados aqui.

© 2026 DotsAgent · Fatos verificados em 1 de outubro de 2026