Generador de robots.txt para bots de IA
Elige una política para cada tipo de bot de IA, configura excepciones para crawlers concretos y copia un archivo compatible con RFC 9309. El entrenamiento, las búsquedas y las solicitudes iniciadas por usuarios usan tokens distintos, así que puedes bloquear unos y permitir otros.
# Crawlers de IA bloqueados en todo el sitio
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /
# Crawlers de IA permitidos, excepto las rutas privadas
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/
# Todos los demás crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml
robots.txt es voluntario. ChatGPT-User, Perplexity-User y otros bots que obtienen páginas a petición de un usuario indican que estas reglas pueden no aplicarse, y algunos agentes no tienen ningún token. Para aplicar un bloqueo, compara las solicitudes con las listas de IP o las firmas publicadas y recházalas en el firewall o WAF.
Cómo funciona el archivo generado
Cada crawler sigue su propio grupo
Si un crawler encuentra su token en una línea User-agent, sigue las reglas de ese grupo e ignora las que aparecen bajo User-agent: *. Por eso, el generador repite las rutas privadas para los bots que permites por nombre y asigna a los bots bloqueados un único Disallow: /.
Algunos tokens no realizan rastreos
Google-Extended y Applebot-Extended no tienen un agente de usuario propio. Googlebot y Applebot son quienes obtienen las páginas, y los tokens extendidos indican a Google y Apple si ese contenido se puede usar para entrenar sus modelos. Google también aplica Google-Extended al grounding de Gemini.
La mayoría de los operadores separan el entrenamiento de la búsqueda
OpenAI, Anthropic, Amazon y Mistral tienen tokens distintos para el entrenamiento y la búsqueda, así que el ajuste Sin entrenamiento mantiene tu sitio disponible en sus productos de búsqueda. Meta es la excepción: meta-externalagent se ocupa tanto del entrenamiento como de la indexación.
Applebot recurre a Googlebot si hace falta
Si tu archivo no incluye un grupo Applebot, Apple indica que Applebot sigue las reglas de Googlebot. Applebot también ignora Crawl-delay, al igual que Amazonbot, mientras que Anthropic indica que ClaudeBot sí lo respeta.
Preguntas sobre robots.txt y los bots de IA
¿Cómo puedo bloquear GPTBot y mantenerme en la búsqueda de ChatGPT?
Añade Disallow para GPTBot y permite OAI-SearchBot. GPTBot recopila datos de entrenamiento, OAI-SearchBot indexa páginas para la búsqueda de ChatGPT y ChatGPT-User obtiene las páginas que alguien solicita. OpenAI documenta los tres en una misma página, cada uno con su propia lista de IP.
¿Bloquear Google-Extended excluye mi sitio de Google Search?
Google-Extended es un token de control sin agente de usuario propio; Googlebot es quien rastrea las páginas. Añadir Disallow para Google-Extended indica a Google que no use tu contenido para entrenar Gemini ni para su grounding, mientras que las reglas de Googlebot determinan qué páginas se rastrean para Search.
¿Los crawlers de IA respetan Crawl-delay?
Algunos sí. Anthropic indica que ClaudeBot lo respeta, mientras que Apple y Amazon dicen que Applebot y Amazonbot no lo hacen. Limitar la frecuencia de solicitudes en el servidor es la opción más fiable.
¿Por qué ChatGPT-User sigue accediendo al sitio después de bloquearlo?
OpenAI indica que las reglas de robots.txt pueden no aplicarse a ChatGPT-User porque alguien ha solicitado la página. Perplexity-User, Amzn-User y meta-externalfetcher incluyen advertencias similares. Si el operador publica una lista de IP, compara las solicitudes con ella y bloquéalas en el firewall.
¿Para qué sirve Content-Signal en robots.txt?
Indica cómo se puede usar el contenido una vez obtenido mediante tres señales: search, ai-input y ai-train, cada una con el valor yes o no. Expresa una preferencia, pero no bloquea nada. Markdown for Agents de Cloudflare añade ai-train=yes, search=yes y ai-input=yes de forma predeterminada, así que comprueba el resultado si usas esa función.