dotsagent.io
Idioma:Español
Abre tu sitio · referencia

Prepara tu sitio para que lo lean los agentes de IA

Los crawlers y agentes de IA leen tu sitio de forma distinta a las personas. Las herramientas de abajo generan los archivos que buscan; la referencia explica qué convenciones son estándares, cuáles son borradores y cuántos clientes las usan realmente.

Las convenciones y su grado de consolidación

Estado a octubre de 2026. Cada entrada enlaza con la especificación o con las pruebas correspondientes para que puedas valorar qué merece la pena implementar en tu sitio.

robots.txt Estándar

El archivo situado en la raíz de tu sitio identifica los crawlers por token y enumera las rutas que debe omitir cada uno; está estandarizado como RFC 9309. Los operadores de IA publican ahora tokens distintos para entrenamiento, búsqueda y obtención iniciada por el usuario, así que un único archivo puede rechazar el entrenamiento y permitir las búsquedas. El cumplimiento es voluntario y varios crawlers que obtienen contenido a petición del usuario indican que estas reglas podrían no aplicarse a ellos.

/robots.txt
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

platform.openai.comdevelopers.google.com

Content-Signal Uso generalizado

Una línea adicional en robots.txt que especifica cómo se puede usar el contenido obtenido: search, ai-input y ai-train, cada uno con el valor yes o no. Cloudflare la publicó como política CC0 en September 2025 y la ofrece en unos 3.8 millones de dominios mediante su robots.txt gestionado. El borrador correspondiente del IETF caducó el 4 April 2026, mientras que el grupo de trabajo AIPREF del IETF sigue adelante con un borrador de vocabulario.

/robots.txt
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /

blog.cloudflare.comdatatracker.ietf.org

llms.txt Propuesta

Un archivo Markdown en /llms.txt con un nombre como H1, un resumen en una cita en bloque y secciones H2 con enlaces, para que un agente pueda acceder a las páginas clave sin analizar la navegación. La especificación de llmstxt.org se revisó el 10 August 2026, y llms-full.txt no forma parte de ella. No tenemos constancia de que ningún operador afirme que algún crawler importante lea este archivo.

/llms.txt
# Acme API

> Card payments for small online shops.

## Docs

- [Quickstart](https://example.com/docs/quickstart.md): first request

llmstxt.orgllmstxt.org

Versiones Markdown de las páginas Adopción parcial

Publica una copia Markdown de cada página en page.md o page.html.md, o sirve contenido Markdown cuando una solicitud incluya un encabezado Accept que pida text/markdown. En la prueba de Checkly de February 2026, Claude Code, Cursor y OpenCode enviaron ese encabezado; Codex, Gemini CLI, GitHub Copilot y Windsurf no lo hicieron. AnswerShare contabilizó 1,277,965 solicitudes de crawlers de vanguardia, y ninguna pidió Markdown.

Request
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdown

developers.cloudflare.comchecklyhq.comanswershare.com

Catálogo de API Estándar

La RFC 9727, publicada en June 2025, reserva /.well-known/api-catalog para una lista de tus API públicas, cada una enlazada a su descripción legible por máquina, documentación y página de estado. La respuesta debe ser application/linkset+json, y otras páginas pueden enlazar a ella mediante la relación de enlace api-catalog.

/.well-known/api-catalog
{
  "linkset": [
    {
      "anchor": "https://api.example.com/v1",
      "service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
    }
  ]
}

rfc-editor.org

Solicitudes de agentes firmadas (Web Bot Auth) Borrador

Los agentes firman cada solicitud con HTTP Message Signatures (RFC 9421) e identifican a su operador en un encabezado Signature-Agent. Verificas la firma con las claves que el operador publica en /.well-known/http-message-signatures-directory. El borrador del grupo de trabajo del IETF es del 1 September 2026; el agente de ChatGPT ya firma como https://chatgpt.com, y Google está probando https://agent.bot.goog.

Request header
Signature-Agent: "https://chatgpt.com"

datatracker.ietf.orgblog.cloudflare.com

NLWeb Estancado

NLWeb, de Microsoft, ofrece los endpoints /ask y /mcp para que los agentes consulten un sitio en lenguaje natural. Su especificación está en la versión 0.55. Lumar informa de que el certificado de nlweb.ai caducó el 4 de agosto de 2026 y de que el repositorio apenas ha tenido actividad desde junio, así que espera antes de basarte en él.

github.comagentic-readiness.lumar.io

Agentes que no se identifican

Algunos agentes no publican ningún token en robots.txt y navegan como lo haría un usuario, por lo que ninguna regla User-agent puede detectarlos. ChatGPT agent firma sus solicitudes con Web Bot Auth y envía Signature-Agent: "https://chatgpt.com", que puedes comprobar en el directorio de claves de OpenAI; Cloudflare etiqueta ese tráfico como chatgpt-agent. Gemini Spark en el modo local de Chrome y Muse, de Meta, no tienen ninguna señal documentada.

Preguntas sobre sitios preparados para agentes

¿Qué hace que un sitio web esté preparado para agentes?

No existe una norma única que lo defina. En la práctica, significa tener un robots.txt que identifique los bots de IA según su finalidad, archivos opcionales como llms.txt y un catálogo de API, versiones Markdown de las páginas clave y una forma de verificar los agentes a los que permites el acceso. De estos elementos, solo robots.txt y el catálogo de API son RFC publicados.

¿Los crawlers de IA leen llms.txt?

No tenemos documentación de ningún operador que indique que los crawlers de nuestro directorio lo descarguen. Lighthouse comprueba si el archivo existe, y un agente al que se lo indiques puede leerlo como cualquier otra página. Considéralo una comodidad para los agentes, no una función de búsqueda.

¿Debería bloquear los crawlers de IA en mi sitio?

Decide según la finalidad, no bloquees todo de una vez. Puedes rechazar los tokens de entrenamiento, como GPTBot, ClaudeBot y Google-Extended, sin afectar a las búsquedas. Bloquear tokens de búsqueda como OAI-SearchBot o PerplexityBot te dejará completamente fuera de esos productos.

¿Puedo bloquear ChatGPT agent con robots.txt?

No, porque no publica ningún token. Puedes reconocerlo por su firma Web Bot Auth de https://chatgpt.com y permitirlo o denegarlo en tu servidor o CDN. Una firma válida demuestra qué operador envió la solicitud, no quién es el usuario ni qué puede hacer.

¿Content-Signal es una norma oficial?

No. Es una política CC0 de Cloudflare, lanzada en septiembre de 2025 y servida en unos 3,8 millones de dominios mediante el robots.txt gestionado por Cloudflare. Su borrador del IETF caducó el 4 de abril de 2026 y el grupo de trabajo AIPREF sigue definiendo un vocabulario común.