Directorio de crawlers y agentes de IA
Cada bot de IA que hemos podido confirmar, con el token que se debe usar en robots.txt, qué contenido obtiene, si su operador afirma que respeta las reglas y cómo comprobar que una solicitud realmente procede de ese bot. Los tokens conocidos solo por el registro comunitario ai.robots.txt se indican como tales en sus páginas.
| Bot | Token | Finalidad | Respeta robots.txt | Verificación |
|---|---|---|---|---|
| GPTBot | GPTBot | Entrenamiento | Sí | Lista de IP |
| OAI-SearchBot | OAI-SearchBot | Búsqueda | Sí | Lista de IP |
| ChatGPT-User | ChatGPT-User | Solicitudes de usuarios | No | Lista de IP |
| OAI-AdsBot | OAI-AdsBot | Anuncios | No especificado | Lista de IP |
| ChatGPT agent | Sin token | Agentes | No especificado | Solicitudes firmadas |
| ClaudeBot | ClaudeBot | Entrenamiento | Sí | Lista de IP |
| Claude-SearchBot | Claude-SearchBot | Búsqueda | Sí | Lista de IP |
| Claude-User | Claude-User | Solicitudes de usuarios | Sí | Lista de IP |
| Googlebot | Googlebot | Búsqueda | Sí | Lista de IP |
| Google-Extended | Google-Extended | Entrenamiento | Sí | — |
| Google-CloudVertexBot | Google-CloudVertexBot | Búsqueda | Sí | Lista de IP |
| GoogleOther | GoogleOther | Entrenamiento | Sí | Lista de IP |
| Google-Agent | Google-Agent | Agentes | No | Lista de IP |
| Google-GeminiNotebook | Google-GeminiNotebook | Solicitudes de usuarios | No | Lista de IP |
| Gemini Spark | Sin token | Agentes | No especificado | — |
| Gemini-Deep-Research | Gemini-Deep-Research | Solicitudes de usuarios | No especificado | — |
| GoogleAgent-Mariner | GoogleAgent-Mariner | Agentes | No especificado | — |
| Applebot | Applebot | Búsqueda | Sí | Lista de IP |
| Applebot-Extended | Applebot-Extended | Entrenamiento | Sí | — |
| PerplexityBot | PerplexityBot | Búsqueda | Sí | Lista de IP |
| Perplexity-User | Perplexity-User | Solicitudes de usuarios | No | Lista de IP |
| meta-externalagent | meta-externalagent | Entrenamiento | Sí | — |
| meta-webindexer | meta-webindexer | Búsqueda | Sí | — |
| meta-externalfetcher | meta-externalfetcher | Solicitudes de usuarios | No | — |
| meta-externalads | meta-externalads | Anuncios | Sí | — |
| facebookexternalhit | facebookexternalhit | Solicitudes de usuarios | No | — |
| Muse | Sin token | Agentes | No especificado | — |
| Amazonbot | Amazonbot | Entrenamiento | Sí | Lista de IP |
| Amzn-SearchBot | Amzn-SearchBot | Búsqueda | Sí | Lista de IP |
| Amzn-User | Amzn-User | Solicitudes de usuarios | No | Lista de IP |
| DuckAssistBot | DuckAssistBot | Búsqueda | Sí | Lista de IP |
| MistralAI-User | MistralAI-User | Solicitudes de usuarios | Sí | Lista de IP |
| MistralAI-Index | MistralAI-Index | Búsqueda | Sí | Lista de IP |
| MistralAI-Training | MistralAI-Training | Entrenamiento | Sí | — |
| CCBot | CCBot | Entrenamiento | Sí | Lista de IP |
| cohere-ai | cohere-ai | Solicitudes de usuarios | No especificado | — |
| Bytespider | Bytespider | Entrenamiento | No | — |
| YouBot | YouBot | Búsqueda | No especificado | — |
| Diffbot | Diffbot | Búsqueda | No especificado | — |
| Timpibot | Timpibot | Entrenamiento | No especificado | — |
Qué significa cada finalidad
- Entrenamiento
- Recopila páginas para entrenar modelos o rastrear contenido con fines de investigación general. Google-Extended y Applebot-Extended son tokens de control que no obtienen contenido por sí mismos.
- Búsqueda
- Indexa páginas para un producto de búsqueda, desde Google Search hasta motores de respuestas de IA como ChatGPT search, Perplexity y DuckAssist. Bloquearlo impide que tu sitio aparezca en ese producto.
- Solicitudes de usuarios
- Obtiene una página porque alguien la ha solicitado en un chat o una herramienta. Varios operadores afirman que robots.txt puede no aplicarse a estas solicitudes.
- Agentes
- Navega y actúa en nombre de una persona, a menudo con un navegador completo. Muchos no tienen token y solo se pueden identificar mediante una firma, si es que se pueden identificar.
- Anuncios
- Comprueba las páginas de destino de anuncios enviadas por anunciantes. Estos bots no se incluyen en el generador de robots.txt.
Comprueba que un bot es quien dice ser
Es fácil falsificar una cadena de user-agent. La mayoría de los operadores grandes publican los rangos de IP que usan sus bots en archivos JSON, indicados como lista de IP en la tabla. Compara la dirección de la solicitud con la lista de ese token y considera que una coincidencia solo en el nombre no está verificada.
Algunos operadores también documentan el DNS inverso. Common Crawl, por ejemplo, indica que los hosts de CCBot se resuelven como *.crawl.commoncrawl.org; antes de confiar en él, comprueba que el nombre de host se resuelva de nuevo a la misma dirección.
Cada vez más agentes firman las solicitudes con HTTP Message Signatures (RFC 9421) según el borrador de Web Bot Auth. La solicitud identifica al operador en Signature-Agent y puedes verificarlo con las claves públicas de /.well-known/http-message-signatures-directory en ese dominio. Una firma válida demuestra quién es el operador, pero no quién es el usuario ni qué puede hacer.
Crear un robots.txt a partir de esta lista →
Preguntas sobre los rastreadores de IA
¿Qué rastreadores de IA ignoran robots.txt?
Según la documentación de sus propios operadores, es posible que ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher y facebookexternalhit no lo respeten, principalmente porque la solicitud la inicia un usuario. Según la comunidad, Bytespider no lo respeta.
¿Cuál es la diferencia entre GPTBot, OAI-SearchBot y ChatGPT-User?
GPTBot recopila páginas para entrenar modelos de OpenAI, OAI-SearchBot indexa páginas para la búsqueda de ChatGPT y ChatGPT-User obtiene una página cuando alguien la solicita. Los dos primeros respetan robots.txt; OpenAI indica que sus reglas pueden no aplicarse al tercero.
¿Qué agentes de IA no tienen un token de robots.txt?
ChatGPT agent, Gemini Spark y Muse de Meta. ChatGPT agent se puede verificar mediante su firma de Web Bot Auth de https://chatgpt.com. Gemini Spark en el modo local de Chrome se identifica como el navegador del usuario, y Muse no tiene un user-agent publicado.
¿Cómo puedo verificar que una solicitud procede realmente de Googlebot?
Google publica los rangos de IP de Googlebot en un archivo JSON, enlazado desde su ficha de este directorio. Comprueba la dirección de la solicitud con esos rangos en lugar de confiar en la cadena de user-agent.
¿De dónde sale esta lista de bots de IA?
Cada ficha enlaza a la documentación del operador, si existe. Los tokens sin documentación proceden del registro comunitario ai.robots.txt. Hemos excluido DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin y PetalBot porque no encontramos documentación de sus operadores. La lista se revisó el 1 de octubre de 2026.