---
title: "Diretório de bots de IA: 40 crawlers, tokens e listas de IPs · DotsAgent"
description: "40 crawlers e agentes de IA da OpenAI, Anthropic, Google, Apple, Meta, Amazon e outras empresas, com token para robots.txt, finalidade, conformidade e lista de IPs."
url: https://dotsagent.io/pt/agent-ready/bots
---

40 crawlers e agentes

# Diretório de crawlers e agentes de IA

Cada bot de IA que conseguimos confirmar, com o token usado em robots.txt, o que ele busca, se o operador afirma seguir as regras e como verificar se uma requisição realmente vem dele. Tokens conhecidos apenas pelo registro comunitário ai.robots.txt estão identificados nas respectivas páginas.

| Bot | Token | Finalidade | Segue robots.txt | Verificação |
| --- | --- | --- | --- | --- |
| [GPTBot](https://dotsagent.io/pt/agent-ready/bots/gptbot)OpenAI | `GPTBot` | Treinamento | — | Lista de IPs |
| [OAI-SearchBot](https://dotsagent.io/pt/agent-ready/bots/oai-searchbot)OpenAI | `OAI-SearchBot` | Busca | — | Lista de IPs |
| [ChatGPT-User](https://dotsagent.io/pt/agent-ready/bots/chatgpt-user)OpenAI | `ChatGPT-User` | Acesso do usuário | — | Lista de IPs |
| [OAI-AdsBot](https://dotsagent.io/pt/agent-ready/bots/oai-adsbot)OpenAI | `OAI-AdsBot` | Anúncios | — | Lista de IPs |
| [ChatGPT agent](https://dotsagent.io/pt/agent-ready/bots/chatgpt-agent)OpenAI | Sem token | Agentes | — | Requisições assinadas |
| [ClaudeBot](https://dotsagent.io/pt/agent-ready/bots/claudebot)Anthropic | `ClaudeBot` | Treinamento | — | Lista de IPs |
| [Claude-SearchBot](https://dotsagent.io/pt/agent-ready/bots/claude-searchbot)Anthropic | `Claude-SearchBot` | Busca | — | Lista de IPs |
| [Claude-User](https://dotsagent.io/pt/agent-ready/bots/claude-user)Anthropic | `Claude-User` | Acesso do usuário | — | Lista de IPs |
| [Googlebot](https://dotsagent.io/pt/agent-ready/bots/googlebot)Google | `Googlebot` | Busca | — | Lista de IPs |
| [Google-Extended](https://dotsagent.io/pt/agent-ready/bots/google-extended)Google | `Google-Extended` | Treinamento | — | — |
| [Google-CloudVertexBot](https://dotsagent.io/pt/agent-ready/bots/google-cloudvertexbot)Google | `Google-CloudVertexBot` | Busca | — | Lista de IPs |
| [GoogleOther](https://dotsagent.io/pt/agent-ready/bots/googleother)Google | `GoogleOther` | Treinamento | — | Lista de IPs |
| [Google-Agent](https://dotsagent.io/pt/agent-ready/bots/google-agent)Google | `Google-Agent` | Agentes | — | Lista de IPs |
| [Google-GeminiNotebook](https://dotsagent.io/pt/agent-ready/bots/google-gemininotebook)Google | `Google-GeminiNotebook` | Acesso do usuário | — | Lista de IPs |
| [Gemini Spark](https://dotsagent.io/pt/agent-ready/bots/gemini-spark)Google | Sem token | Agentes | — | — |
| [Gemini-Deep-Research](https://dotsagent.io/pt/agent-ready/bots/gemini-deep-research)Google | `Gemini-Deep-Research` | Acesso do usuário | — | — |
| [GoogleAgent-Mariner](https://dotsagent.io/pt/agent-ready/bots/googleagent-mariner)Google | `GoogleAgent-Mariner` | Agentes | — | — |
| [Applebot](https://dotsagent.io/pt/agent-ready/bots/applebot)Apple | `Applebot` | Busca | — | Lista de IPs |
| [Applebot-Extended](https://dotsagent.io/pt/agent-ready/bots/applebot-extended)Apple | `Applebot-Extended` | Treinamento | — | — |
| [PerplexityBot](https://dotsagent.io/pt/agent-ready/bots/perplexitybot)Perplexity | `PerplexityBot` | Busca | — | Lista de IPs |
| [Perplexity-User](https://dotsagent.io/pt/agent-ready/bots/perplexity-user)Perplexity | `Perplexity-User` | Acesso do usuário | — | Lista de IPs |
| [meta-externalagent](https://dotsagent.io/pt/agent-ready/bots/meta-externalagent)Meta | `meta-externalagent` | Treinamento | — | — |
| [meta-webindexer](https://dotsagent.io/pt/agent-ready/bots/meta-webindexer)Meta | `meta-webindexer` | Busca | — | — |
| [meta-externalfetcher](https://dotsagent.io/pt/agent-ready/bots/meta-externalfetcher)Meta | `meta-externalfetcher` | Acesso do usuário | — | — |
| [meta-externalads](https://dotsagent.io/pt/agent-ready/bots/meta-externalads)Meta | `meta-externalads` | Anúncios | — | — |
| [facebookexternalhit](https://dotsagent.io/pt/agent-ready/bots/facebookexternalhit)Meta | `facebookexternalhit` | Acesso do usuário | — | — |
| [Muse](https://dotsagent.io/pt/agent-ready/bots/muse)Meta | Sem token | Agentes | — | — |
| [Amazonbot](https://dotsagent.io/pt/agent-ready/bots/amazonbot)Amazon | `Amazonbot` | Treinamento | — | Lista de IPs |
| [Amzn-SearchBot](https://dotsagent.io/pt/agent-ready/bots/amzn-searchbot)Amazon | `Amzn-SearchBot` | Busca | — | Lista de IPs |
| [Amzn-User](https://dotsagent.io/pt/agent-ready/bots/amzn-user)Amazon | `Amzn-User` | Acesso do usuário | — | Lista de IPs |
| [DuckAssistBot](https://dotsagent.io/pt/agent-ready/bots/duckassistbot)DuckDuckGo | `DuckAssistBot` | Busca | — | Lista de IPs |
| [MistralAI-User](https://dotsagent.io/pt/agent-ready/bots/mistralai-user)Mistral | `MistralAI-User` | Acesso do usuário | — | Lista de IPs |
| [MistralAI-Index](https://dotsagent.io/pt/agent-ready/bots/mistralai-index)Mistral | `MistralAI-Index` | Busca | — | Lista de IPs |
| [MistralAI-Training](https://dotsagent.io/pt/agent-ready/bots/mistralai-training)Mistral | `MistralAI-Training` | Treinamento | — | — |
| [CCBot](https://dotsagent.io/pt/agent-ready/bots/ccbot)Common Crawl | `CCBot` | Treinamento | — | Lista de IPs |
| [cohere-ai](https://dotsagent.io/pt/agent-ready/bots/cohere-ai)Cohere | `cohere-ai` | Acesso do usuário | — | — |
| [Bytespider](https://dotsagent.io/pt/agent-ready/bots/bytespider)ByteDance | `Bytespider` | Treinamento | — | — |
| [YouBot](https://dotsagent.io/pt/agent-ready/bots/youbot)You.com | `YouBot` | Busca | — | — |
| [Diffbot](https://dotsagent.io/pt/agent-ready/bots/diffbot)Diffbot | `Diffbot` | Busca | — | — |
| [Timpibot](https://dotsagent.io/pt/agent-ready/bots/timpibot)Timpi | `Timpibot` | Treinamento | — | — |

## O que significam as finalidades

- **Treinamento**: Coleta páginas para treinar modelos ou fazer crawls de pesquisa geral. Google-Extended e Applebot-Extended são tokens de controle que não buscam conteúdo por conta própria.
- **Busca**: Indexa páginas para um produto de busca, do Google Search a mecanismos de respostas com IA, como a busca do ChatGPT, Perplexity e DuckAssist. Bloquear um bot impede que suas páginas apareçam nesse produto.
- **Acesso do usuário**: Busca uma página a pedido de alguém em um chat ou ferramenta. Vários operadores afirmam que robots.txt pode não se aplicar a essas requisições.
- **Agentes**: Navega e realiza ações em nome do usuário, geralmente em um navegador completo. Muitos não têm token e só podem ser identificados por assinatura, se isso for possível.
- **Anúncios**: Verifica páginas de destino de anúncios enviadas por anunciantes. Esses bots não são incluídos no gerador de robots.txt.

## Verifique a identidade de um bot

É fácil falsificar uma string de user-agent. A maioria dos grandes operadores publica em arquivos JSON os intervalos de IP usados pelos seus bots, identificados como lista de IPs na tabela. Compare o endereço da requisição com a lista correspondente ao token e considere não verificada qualquer correspondência baseada apenas no nome.

Alguns operadores também documentam o DNS reverso. A Common Crawl, por exemplo, informa que os hosts do CCBot são resolvidos para *.crawl.commoncrawl.org; antes de confiar nessa informação, confirme que o hostname também é resolvido de volta para o mesmo endereço.

Cada vez mais, os agentes assinam requisições usando HTTP Message Signatures (RFC 9421), conforme o rascunho do Web Bot Auth. A requisição identifica o operador em Signature-Agent, e a verificação é feita com as chaves públicas disponíveis em /.well-known/http-message-signatures-directory no domínio correspondente. Uma assinatura válida comprova a identidade do operador, não a do usuário por trás da requisição nem o que esse usuário pode fazer.

[Gerar um robots.txt com esta lista →](https://dotsagent.io/pt/agent-ready/robots-txt)

## Dúvidas sobre rastreadores de IA

### Quais rastreadores de IA ignoram o robots.txt?

Segundo a documentação dos próprios operadores, ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher e facebookexternalhit podem não seguir as regras, principalmente porque a busca é iniciada por um usuário. Segundo relatos da comunidade, o Bytespider não respeita essas regras.

### Qual é a diferença entre GPTBot, OAI-SearchBot e ChatGPT-User?

O GPTBot coleta páginas para treinar modelos da OpenAI, o OAI-SearchBot indexa páginas para a busca do ChatGPT e o ChatGPT-User acessa uma página quando alguém solicita. Os dois primeiros seguem o robots.txt; a OpenAI informa que as regras talvez não se apliquem ao terceiro.

### Quais agentes de IA não têm um token para robots.txt?

ChatGPT agent, Gemini Spark e Muse, da Meta. É possível verificar o ChatGPT agent pela assinatura Web Bot Auth de https://chatgpt.com. No modo local do Chrome, o Gemini Spark se parece com o navegador do próprio usuário, e a Muse não tem um user-agent publicado.

### Como verificar se uma requisição realmente vem do Googlebot?

O Google publica os intervalos de IP do Googlebot em um arquivo JSON, vinculado à entrada correspondente neste diretório. Confira se o endereço da requisição está nesses intervalos, em vez de confiar na string de user-agent.

### De onde vem esta lista de bots de IA?

Cada entrada inclui um link para a documentação do operador, quando disponível. Os tokens sem documentação vêm do registro comunitário ai.robots.txt. Não incluímos DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin e PetalBot porque não encontramos documentação dos operadores. A lista foi verificada em 1 October 2026.

Referência independente para quem cria agentes de IA. Não temos vínculo com nenhum dos fornecedores mencionados aqui.

© 2026 DotsAgent · Fatos verificados em 1 de outubro de 2026
