dotsagent.io
Idioma:Español
40 crawlers y agentes

Directorio de crawlers y agentes de IA

Cada bot de IA que hemos podido confirmar, con el token que se debe usar en robots.txt, qué contenido obtiene, si su operador afirma que respeta las reglas y cómo comprobar que una solicitud realmente procede de ese bot. Los tokens conocidos solo por el registro comunitario ai.robots.txt se indican como tales en sus páginas.

BotTokenFinalidadRespeta robots.txtVerificación
GPTBot
OpenAI
GPTBotEntrenamientoSíLista de IP
OAI-SearchBot
OpenAI
OAI-SearchBotBúsquedaSíLista de IP
ChatGPT-User
OpenAI
ChatGPT-UserSolicitudes de usuariosNoLista de IP
OAI-AdsBot
OpenAI
OAI-AdsBotAnunciosNo especificadoLista de IP
ChatGPT agent
OpenAI
Sin tokenAgentesNo especificadoSolicitudes firmadas
ClaudeBot
Anthropic
ClaudeBotEntrenamientoSíLista de IP
Claude-SearchBot
Anthropic
Claude-SearchBotBúsquedaSíLista de IP
Claude-User
Anthropic
Claude-UserSolicitudes de usuariosSíLista de IP
Googlebot
Google
GooglebotBúsquedaSíLista de IP
Google-Extended
Google
Google-ExtendedEntrenamientoSí—
Google-CloudVertexBot
Google
Google-CloudVertexBotBúsquedaSíLista de IP
GoogleOther
Google
GoogleOtherEntrenamientoSíLista de IP
Google-Agent
Google
Google-AgentAgentesNoLista de IP
Google-GeminiNotebook
Google
Google-GeminiNotebookSolicitudes de usuariosNoLista de IP
Gemini Spark
Google
Sin tokenAgentesNo especificado—
Gemini-Deep-Research
Google
Gemini-Deep-ResearchSolicitudes de usuariosNo especificado—
GoogleAgent-Mariner
Google
GoogleAgent-MarinerAgentesNo especificado—
Applebot
Apple
ApplebotBúsquedaSíLista de IP
Applebot-Extended
Apple
Applebot-ExtendedEntrenamientoSí—
PerplexityBot
Perplexity
PerplexityBotBúsquedaSíLista de IP
Perplexity-User
Perplexity
Perplexity-UserSolicitudes de usuariosNoLista de IP
meta-externalagent
Meta
meta-externalagentEntrenamientoSí—
meta-webindexer
Meta
meta-webindexerBúsquedaSí—
meta-externalfetcher
Meta
meta-externalfetcherSolicitudes de usuariosNo—
meta-externalads
Meta
meta-externaladsAnunciosSí—
facebookexternalhit
Meta
facebookexternalhitSolicitudes de usuariosNo—
Muse
Meta
Sin tokenAgentesNo especificado—
Amazonbot
Amazon
AmazonbotEntrenamientoSíLista de IP
Amzn-SearchBot
Amazon
Amzn-SearchBotBúsquedaSíLista de IP
Amzn-User
Amazon
Amzn-UserSolicitudes de usuariosNoLista de IP
DuckAssistBot
DuckDuckGo
DuckAssistBotBúsquedaSíLista de IP
MistralAI-User
Mistral
MistralAI-UserSolicitudes de usuariosSíLista de IP
MistralAI-Index
Mistral
MistralAI-IndexBúsquedaSíLista de IP
MistralAI-Training
Mistral
MistralAI-TrainingEntrenamientoSí—
CCBot
Common Crawl
CCBotEntrenamientoSíLista de IP
cohere-ai
Cohere
cohere-aiSolicitudes de usuariosNo especificado—
Bytespider
ByteDance
BytespiderEntrenamientoNo—
YouBot
You.com
YouBotBúsquedaNo especificado—
Diffbot
Diffbot
DiffbotBúsquedaNo especificado—
Timpibot
Timpi
TimpibotEntrenamientoNo especificado—

Qué significa cada finalidad

Entrenamiento
Recopila páginas para entrenar modelos o rastrear contenido con fines de investigación general. Google-Extended y Applebot-Extended son tokens de control que no obtienen contenido por sí mismos.
Búsqueda
Indexa páginas para un producto de búsqueda, desde Google Search hasta motores de respuestas de IA como ChatGPT search, Perplexity y DuckAssist. Bloquearlo impide que tu sitio aparezca en ese producto.
Solicitudes de usuarios
Obtiene una página porque alguien la ha solicitado en un chat o una herramienta. Varios operadores afirman que robots.txt puede no aplicarse a estas solicitudes.
Agentes
Navega y actúa en nombre de una persona, a menudo con un navegador completo. Muchos no tienen token y solo se pueden identificar mediante una firma, si es que se pueden identificar.
Anuncios
Comprueba las páginas de destino de anuncios enviadas por anunciantes. Estos bots no se incluyen en el generador de robots.txt.

Comprueba que un bot es quien dice ser

Es fácil falsificar una cadena de user-agent. La mayoría de los operadores grandes publican los rangos de IP que usan sus bots en archivos JSON, indicados como lista de IP en la tabla. Compara la dirección de la solicitud con la lista de ese token y considera que una coincidencia solo en el nombre no está verificada.

Algunos operadores también documentan el DNS inverso. Common Crawl, por ejemplo, indica que los hosts de CCBot se resuelven como *.crawl.commoncrawl.org; antes de confiar en él, comprueba que el nombre de host se resuelva de nuevo a la misma dirección.

Cada vez más agentes firman las solicitudes con HTTP Message Signatures (RFC 9421) según el borrador de Web Bot Auth. La solicitud identifica al operador en Signature-Agent y puedes verificarlo con las claves públicas de /.well-known/http-message-signatures-directory en ese dominio. Una firma válida demuestra quién es el operador, pero no quién es el usuario ni qué puede hacer.

Crear un robots.txt a partir de esta lista →

Preguntas sobre los rastreadores de IA

¿Qué rastreadores de IA ignoran robots.txt?

Según la documentación de sus propios operadores, es posible que ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher y facebookexternalhit no lo respeten, principalmente porque la solicitud la inicia un usuario. Según la comunidad, Bytespider no lo respeta.

¿Cuál es la diferencia entre GPTBot, OAI-SearchBot y ChatGPT-User?

GPTBot recopila páginas para entrenar modelos de OpenAI, OAI-SearchBot indexa páginas para la búsqueda de ChatGPT y ChatGPT-User obtiene una página cuando alguien la solicita. Los dos primeros respetan robots.txt; OpenAI indica que sus reglas pueden no aplicarse al tercero.

¿Qué agentes de IA no tienen un token de robots.txt?

ChatGPT agent, Gemini Spark y Muse de Meta. ChatGPT agent se puede verificar mediante su firma de Web Bot Auth de https://chatgpt.com. Gemini Spark en el modo local de Chrome se identifica como el navegador del usuario, y Muse no tiene un user-agent publicado.

¿Cómo puedo verificar que una solicitud procede realmente de Googlebot?

Google publica los rangos de IP de Googlebot en un archivo JSON, enlazado desde su ficha de este directorio. Comprueba la dirección de la solicitud con esos rangos en lugar de confiar en la cadena de user-agent.

¿De dónde sale esta lista de bots de IA?

Cada ficha enlaza a la documentación del operador, si existe. Los tokens sin documentación proceden del registro comunitario ai.robots.txt. Hemos excluido DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin y PetalBot porque no encontramos documentación de sus operadores. La lista se revisó el 1 de octubre de 2026.