dotsagent.io
Idioma:Español
Configura tu sitio · generador

Generador de robots.txt para bots de IA

Elige una política para cada tipo de bot de IA, configura excepciones para crawlers concretos y copia un archivo compatible con RFC 9309. El entrenamiento, las búsquedas y las solicitudes iniciadas por usuarios usan tokens distintos, así que puedes bloquear unos y permitir otros.

Empezar con
Entrenamiento

Al bloquear estos bots, excluyes tus páginas del entrenamiento de modelos por parte de estos operadores y mantienes intactos los resultados de búsqueda.

Búsqueda

Bloquearlos también bloquea Googlebot y Applebot, lo que excluye tu sitio de Google Search y de los resultados de Siri, Spotlight y Safari de Apple.

Solicitudes de usuarios

Estos bots obtienen una página porque alguien la ha solicitado, y varios operadores indican que robots.txt puede no aplicarse en estos casos. Por tanto, bloquearlos es una petición, no una garantía.

Agentes

Google-Agent suele ignorar robots.txt y la mayoría de los agentes de navegación no tienen ningún token, así que este grupo apenas cambia nada en la práctica.

Haz clic en un bot para invertir su ajuste respecto al del grupo.

Content-Signal
search
ai-input
ai-train

Content-Signal indica cómo se pueden usar las páginas obtenidas: search para los resultados de búsqueda, ai-input para generar respuestas de IA y ai-train para entrenar modelos. Procede de la política CC0 de Cloudflare y expresa una preferencia, pero no bloquea nada.

/robots.txt
# Crawlers de IA bloqueados en todo el sitio
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Crawlers de IA permitidos, excepto las rutas privadas
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Todos los demás crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

robots.txt es voluntario. ChatGPT-User, Perplexity-User y otros bots que obtienen páginas a petición de un usuario indican que estas reglas pueden no aplicarse, y algunos agentes no tienen ningún token. Para aplicar un bloqueo, compara las solicitudes con las listas de IP o las firmas publicadas y recházalas en el firewall o WAF.

Consulta todos los bots del directorio →

Cómo funciona el archivo generado

Cada crawler sigue su propio grupo

Si un crawler encuentra su token en una línea User-agent, sigue las reglas de ese grupo e ignora las que aparecen bajo User-agent: *. Por eso, el generador repite las rutas privadas para los bots que permites por nombre y asigna a los bots bloqueados un único Disallow: /.

Algunos tokens no realizan rastreos

Google-Extended y Applebot-Extended no tienen un agente de usuario propio. Googlebot y Applebot son quienes obtienen las páginas, y los tokens extendidos indican a Google y Apple si ese contenido se puede usar para entrenar sus modelos. Google también aplica Google-Extended al grounding de Gemini.

La mayoría de los operadores separan el entrenamiento de la búsqueda

OpenAI, Anthropic, Amazon y Mistral tienen tokens distintos para el entrenamiento y la búsqueda, así que el ajuste Sin entrenamiento mantiene tu sitio disponible en sus productos de búsqueda. Meta es la excepción: meta-externalagent se ocupa tanto del entrenamiento como de la indexación.

Applebot recurre a Googlebot si hace falta

Si tu archivo no incluye un grupo Applebot, Apple indica que Applebot sigue las reglas de Googlebot. Applebot también ignora Crawl-delay, al igual que Amazonbot, mientras que Anthropic indica que ClaudeBot sí lo respeta.

Preguntas sobre robots.txt y los bots de IA

¿Cómo puedo bloquear GPTBot y mantenerme en la búsqueda de ChatGPT?

Añade Disallow para GPTBot y permite OAI-SearchBot. GPTBot recopila datos de entrenamiento, OAI-SearchBot indexa páginas para la búsqueda de ChatGPT y ChatGPT-User obtiene las páginas que alguien solicita. OpenAI documenta los tres en una misma página, cada uno con su propia lista de IP.

¿Bloquear Google-Extended excluye mi sitio de Google Search?

Google-Extended es un token de control sin agente de usuario propio; Googlebot es quien rastrea las páginas. Añadir Disallow para Google-Extended indica a Google que no use tu contenido para entrenar Gemini ni para su grounding, mientras que las reglas de Googlebot determinan qué páginas se rastrean para Search.

¿Los crawlers de IA respetan Crawl-delay?

Algunos sí. Anthropic indica que ClaudeBot lo respeta, mientras que Apple y Amazon dicen que Applebot y Amazonbot no lo hacen. Limitar la frecuencia de solicitudes en el servidor es la opción más fiable.

¿Por qué ChatGPT-User sigue accediendo al sitio después de bloquearlo?

OpenAI indica que las reglas de robots.txt pueden no aplicarse a ChatGPT-User porque alguien ha solicitado la página. Perplexity-User, Amzn-User y meta-externalfetcher incluyen advertencias similares. Si el operador publica una lista de IP, compara las solicitudes con ella y bloquéalas en el firewall.

¿Para qué sirve Content-Signal en robots.txt?

Indica cómo se puede usar el contenido una vez obtenido mediante tres señales: search, ai-input y ai-train, cada una con el valor yes o no. Expresa una preferencia, pero no bloquea nada. Markdown for Agents de Cloudflare añade ai-train=yes, search=yes y ai-input=yes de forma predeterminada, así que comprueba el resultado si usas esa función.

Fuentes

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers