Prepara tu sitio para que lo lean los agentes de IA
Los crawlers y agentes de IA leen tu sitio de forma distinta a las personas. Las herramientas de abajo generan los archivos que buscan; la referencia explica qué convenciones son estándares, cuáles son borradores y cuántos clientes las usan realmente.
Generador de llms.txt
Introduce un nombre, un resumen y secciones de enlaces para copiar un archivo en el formato de llmstxt.org.
robots.txt para bots de IA
Define una política por propósito del bot, activa o desactiva crawlers concretos, añade Content-Signal y descarga el resultado.
Catálogo de API
Enumera tus API con sus archivos OpenAPI y documentación para obtener un linkset RFC 9727 y un bloque de nginx que lo sirva.
Directorio de bots de IA
40 crawlers y agentes, con sus tokens, propósitos, comportamiento en robots.txt y listas de IP publicadas.
Las convenciones y su grado de consolidación
Estado a octubre de 2026. Cada entrada enlaza con la especificación o con las pruebas correspondientes para que puedas valorar qué merece la pena implementar en tu sitio.
robots.txt Estándar
El archivo situado en la raíz de tu sitio identifica los crawlers por token y enumera las rutas que debe omitir cada uno; está estandarizado como RFC 9309. Los operadores de IA publican ahora tokens distintos para entrenamiento, búsqueda y obtención iniciada por el usuario, así que un único archivo puede rechazar el entrenamiento y permitir las búsquedas. El cumplimiento es voluntario y varios crawlers que obtienen contenido a petición del usuario indican que estas reglas podrían no aplicarse a ellos.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal Uso generalizado
Una línea adicional en robots.txt que especifica cómo se puede usar el contenido obtenido: search, ai-input y ai-train, cada uno con el valor yes o no. Cloudflare la publicó como política CC0 en September 2025 y la ofrece en unos 3.8 millones de dominios mediante su robots.txt gestionado. El borrador correspondiente del IETF caducó el 4 April 2026, mientras que el grupo de trabajo AIPREF del IETF sigue adelante con un borrador de vocabulario.
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt Propuesta
Un archivo Markdown en /llms.txt con un nombre como H1, un resumen en una cita en bloque y secciones H2 con enlaces, para que un agente pueda acceder a las páginas clave sin analizar la navegación. La especificación de llmstxt.org se revisó el 10 August 2026, y llms-full.txt no forma parte de ella. No tenemos constancia de que ningún operador afirme que algún crawler importante lea este archivo.
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestVersiones Markdown de las páginas Adopción parcial
Publica una copia Markdown de cada página en page.md o page.html.md, o sirve contenido Markdown cuando una solicitud incluya un encabezado Accept que pida text/markdown. En la prueba de Checkly de February 2026, Claude Code, Cursor y OpenCode enviaron ese encabezado; Codex, Gemini CLI, GitHub Copilot y Windsurf no lo hicieron. AnswerShare contabilizó 1,277,965 solicitudes de crawlers de vanguardia, y ninguna pidió Markdown.
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownCatálogo de API Estándar
La RFC 9727, publicada en June 2025, reserva /.well-known/api-catalog para una lista de tus API públicas, cada una enlazada a su descripción legible por máquina, documentación y página de estado. La respuesta debe ser application/linkset+json, y otras páginas pueden enlazar a ella mediante la relación de enlace api-catalog.
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}Solicitudes de agentes firmadas (Web Bot Auth) Borrador
Los agentes firman cada solicitud con HTTP Message Signatures (RFC 9421) e identifican a su operador en un encabezado Signature-Agent. Verificas la firma con las claves que el operador publica en /.well-known/http-message-signatures-directory. El borrador del grupo de trabajo del IETF es del 1 September 2026; el agente de ChatGPT ya firma como https://chatgpt.com, y Google está probando https://agent.bot.goog.
Signature-Agent: "https://chatgpt.com"NLWeb Estancado
NLWeb, de Microsoft, ofrece los endpoints /ask y /mcp para que los agentes consulten un sitio en lenguaje natural. Su especificación está en la versión 0.55. Lumar informa de que el certificado de nlweb.ai caducó el 4 de agosto de 2026 y de que el repositorio apenas ha tenido actividad desde junio, así que espera antes de basarte en él.
Agentes que no se identifican
Algunos agentes no publican ningún token en robots.txt y navegan como lo haría un usuario, por lo que ninguna regla User-agent puede detectarlos. ChatGPT agent firma sus solicitudes con Web Bot Auth y envía Signature-Agent: "https://chatgpt.com", que puedes comprobar en el directorio de claves de OpenAI; Cloudflare etiqueta ese tráfico como chatgpt-agent. Gemini Spark en el modo local de Chrome y Muse, de Meta, no tienen ninguna señal documentada.
Preguntas sobre sitios preparados para agentes
¿Qué hace que un sitio web esté preparado para agentes?
No existe una norma única que lo defina. En la práctica, significa tener un robots.txt que identifique los bots de IA según su finalidad, archivos opcionales como llms.txt y un catálogo de API, versiones Markdown de las páginas clave y una forma de verificar los agentes a los que permites el acceso. De estos elementos, solo robots.txt y el catálogo de API son RFC publicados.
¿Los crawlers de IA leen llms.txt?
No tenemos documentación de ningún operador que indique que los crawlers de nuestro directorio lo descarguen. Lighthouse comprueba si el archivo existe, y un agente al que se lo indiques puede leerlo como cualquier otra página. Considéralo una comodidad para los agentes, no una función de búsqueda.
¿Debería bloquear los crawlers de IA en mi sitio?
Decide según la finalidad, no bloquees todo de una vez. Puedes rechazar los tokens de entrenamiento, como GPTBot, ClaudeBot y Google-Extended, sin afectar a las búsquedas. Bloquear tokens de búsqueda como OAI-SearchBot o PerplexityBot te dejará completamente fuera de esos productos.
¿Puedo bloquear ChatGPT agent con robots.txt?
No, porque no publica ningún token. Puedes reconocerlo por su firma Web Bot Auth de https://chatgpt.com y permitirlo o denegarlo en tu servidor o CDN. Una firma válida demuestra qué operador envió la solicitud, no quién es el usuario ni qué puede hacer.
¿Content-Signal es una norma oficial?
No. Es una política CC0 de Cloudflare, lanzada en septiembre de 2025 y servida en unos 3,8 millones de dominios mediante el robots.txt gestionado por Cloudflare. Su borrador del IETF caducó el 4 de abril de 2026 y el grupo de trabajo AIPREF sigue definiendo un vocabulario común.