---
title: "Generador de robots.txt para crawlers y agentes de IA · DotsAgent"
description: "Crea un robots.txt que impida el entrenamiento de IA sin bloquear las búsquedas: 35 tokens de bots agrupados por finalidad, líneas Content-Signal, rutas privadas y una línea de sitemap."
url: https://dotsagent.io/es/agent-ready/robots-txt
---

Configura tu sitio · generador

# Generador de robots.txt para bots de IA

Elige una política para cada tipo de bot de IA, configura excepciones para crawlers concretos y copia un archivo compatible con RFC 9309. El entrenamiento, las búsquedas y las solicitudes iniciadas por usuarios usan tokens distintos, así que puedes bloquear unos y permitir otros.

`/robots.txt`

```
# Crawlers de IA bloqueados en todo el sitio
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Crawlers de IA permitidos, excepto las rutas privadas
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Todos los demás crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml
```

robots.txt es voluntario. ChatGPT-User, Perplexity-User y otros bots que obtienen páginas a petición de un usuario indican que estas reglas pueden no aplicarse, y algunos agentes no tienen ningún token. Para aplicar un bloqueo, compara las solicitudes con las listas de IP o las firmas publicadas y recházalas en el firewall o WAF.

[Consulta todos los bots del directorio →](https://dotsagent.io/es/agent-ready/bots)

## Cómo funciona el archivo generado

### Cada crawler sigue su propio grupo

Si un crawler encuentra su token en una línea User-agent, sigue las reglas de ese grupo e ignora las que aparecen bajo User-agent: *. Por eso, el generador repite las rutas privadas para los bots que permites por nombre y asigna a los bots bloqueados un único Disallow: /.

### Algunos tokens no realizan rastreos

Google-Extended y Applebot-Extended no tienen un agente de usuario propio. Googlebot y Applebot son quienes obtienen las páginas, y los tokens extendidos indican a Google y Apple si ese contenido se puede usar para entrenar sus modelos. Google también aplica Google-Extended al grounding de Gemini.

### La mayoría de los operadores separan el entrenamiento de la búsqueda

OpenAI, Anthropic, Amazon y Mistral tienen tokens distintos para el entrenamiento y la búsqueda, así que el ajuste Sin entrenamiento mantiene tu sitio disponible en sus productos de búsqueda. Meta es la excepción: meta-externalagent se ocupa tanto del entrenamiento como de la indexación.

### Applebot recurre a Googlebot si hace falta

Si tu archivo no incluye un grupo Applebot, Apple indica que Applebot sigue las reglas de Googlebot. Applebot también ignora Crawl-delay, al igual que Amazonbot, mientras que Anthropic indica que ClaudeBot sí lo respeta.

## Preguntas sobre robots.txt y los bots de IA

### ¿Cómo puedo bloquear GPTBot y mantenerme en la búsqueda de ChatGPT?

Añade Disallow para GPTBot y permite OAI-SearchBot. GPTBot recopila datos de entrenamiento, OAI-SearchBot indexa páginas para la búsqueda de ChatGPT y ChatGPT-User obtiene las páginas que alguien solicita. OpenAI documenta los tres en una misma página, cada uno con su propia lista de IP.

### ¿Bloquear Google-Extended excluye mi sitio de Google Search?

Google-Extended es un token de control sin agente de usuario propio; Googlebot es quien rastrea las páginas. Añadir Disallow para Google-Extended indica a Google que no use tu contenido para entrenar Gemini ni para su grounding, mientras que las reglas de Googlebot determinan qué páginas se rastrean para Search.

### ¿Los crawlers de IA respetan Crawl-delay?

Algunos sí. Anthropic indica que ClaudeBot lo respeta, mientras que Apple y Amazon dicen que Applebot y Amazonbot no lo hacen. Limitar la frecuencia de solicitudes en el servidor es la opción más fiable.

### ¿Por qué ChatGPT-User sigue accediendo al sitio después de bloquearlo?

OpenAI indica que las reglas de robots.txt pueden no aplicarse a ChatGPT-User porque alguien ha solicitado la página. Perplexity-User, Amzn-User y meta-externalfetcher incluyen advertencias similares. Si el operador publica una lista de IP, compara las solicitudes con ella y bloquéalas en el firewall.

### ¿Para qué sirve Content-Signal en robots.txt?

Indica cómo se puede usar el contenido una vez obtenido mediante tres señales: search, ai-input y ai-train, cada una con el valor yes o no. Expresa una preferencia, pero no bloquea nada. Markdown for Agents de Cloudflare añade ai-train=yes, search=yes y ai-input=yes de forma predeterminada, así que comprueba el resultado si usas esa función.

## Fuentes

1. [rfc-editor.org](https://www.rfc-editor.org/rfc/rfc9309)/rfc/rfc9309
2. [contentsignals.org](https://contentsignals.org/)/
3. [developers.google.com](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)/search/docs/crawling-indexing/google-common-crawlers

Referencia independiente para quienes crean agentes de IA. No estamos afiliados a ninguno de los proveedores mencionados aquí.

© 2026 DotsAgent · Datos verificados el 1 de octubre de 2026
