dotsagent.io
Langue:Français
Ouvrez votre site · référence

Rendez votre site lisible par les agents IA

Les crawlers et agents IA ne lisent pas votre site comme les humains. Les outils ci-dessous génèrent les fichiers qu’ils recherchent ; la référence qui suit indique quelles conventions sont des standards, lesquelles sont des brouillons et combien de clients les utilisent réellement.

Les conventions et leur degré de maturité

État en octobre 2026. Chaque entrée renvoie vers la spécification ou les éléments qui l’étayent, pour vous aider à évaluer ce qui vaut la peine d’être mis en place sur votre site.

robots.txt Standard

Le fichier placé à la racine de votre site désigne les crawlers par token et répertorie les chemins que chacun doit ignorer ; son format est normalisé par la RFC 9309. Les opérateurs d’IA publient désormais des tokens distincts pour l’entraînement, la recherche et les récupérations déclenchées par l’utilisateur. Un seul fichier peut donc refuser l’entraînement tout en autorisant la recherche. Le respect des règles est volontaire, et plusieurs robots de récupération déclenchée par l’utilisateur indiquent qu’elles peuvent ne pas s’appliquer à eux.

/robots.txt
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

platform.openai.comdevelopers.google.com

Content-Signal Largement utilisé

Une ligne supplémentaire dans robots.txt qui précise comment le contenu récupéré peut être utilisé : search, ai-input et ai-train, avec la valeur yes ou no pour chacun. Cloudflare l’a publiée sous licence CC0 en septembre 2025 et la sert sur environ 3.8 millions de domaines via son robots.txt géré. Le projet de l’IETF correspondant a expiré le 4 avril 2026, mais le groupe de travail AIPREF de l’IETF poursuit ses travaux sur un projet de vocabulaire.

/robots.txt
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /

blog.cloudflare.comdatatracker.ietf.org

llms.txt Proposition

Un fichier Markdown à l’adresse /llms.txt, contenant un titre H1, un résumé en citation et des sections H2 avec des liens, pour permettre à un agent d’accéder à vos pages clés sans analyser la navigation. La spécification sur llmstxt.org a été révisée le 10 août 2026, et llms-full.txt n’en fait pas partie. Aucun opérateur n’a déclaré que son crawler lisait ce fichier.

/llms.txt
# Acme API

> Card payments for small online shops.

## Docs

- [Quickstart](https://example.com/docs/quickstart.md): first request

llmstxt.orgllmstxt.org

Versions Markdown des pages Adoption partielle

Publiez une copie Markdown de chaque page à l’adresse page.md ou page.html.md, ou renvoyez du Markdown pour toute requête dont l’en-tête Accept demande text/markdown. Lors du test de Checkly en février 2026, Claude Code, Cursor et OpenCode ont envoyé cet en-tête, contrairement à Codex, Gemini CLI, GitHub Copilot et Windsurf. AnswerShare a comptabilisé 1,277,965 requêtes de crawlers de pointe ; aucune ne demandait du Markdown.

Request
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdown

developers.cloudflare.comchecklyhq.comanswershare.com

Catalogue d’API Norme

La RFC 9727, publiée en juin 2025, réserve /.well-known/api-catalog à la liste de vos API publiques. Chaque API renvoie à sa description lisible par machine, à sa documentation et à sa page d’état. La réponse doit être au format application/linkset+json, et d’autres pages peuvent y renvoyer à l’aide de la relation de lien api-catalog.

/.well-known/api-catalog
{
  "linkset": [
    {
      "anchor": "https://api.example.com/v1",
      "service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
    }
  ]
}

rfc-editor.org

Requêtes d’agent signées (Web Bot Auth) Projet

Les agents signent chaque requête à l’aide des signatures de messages HTTP (RFC 9421) et indiquent le nom de leur opérateur dans un en-tête Signature-Agent. Vous vérifiez la signature à l’aide des clés publiées par cet opérateur sous /.well-known/http-message-signatures-directory. Le projet du groupe de travail de l’IETF date du 1 septembre 2026 ; l’agent ChatGPT signe déjà ses requêtes avec https://chatgpt.com, et Google expérimente avec https://agent.bot.goog.

Request header
Signature-Agent: "https://chatgpt.com"

datatracker.ietf.orgblog.cloudflare.com

NLWeb À l’arrêt

NLWeb de Microsoft fournit à un site les endpoints /ask et /mcp, que les agents peuvent interroger en langage naturel. Sa spécification est en version 0.55. Lumar signale que le certificat de nlweb.ai a expiré le 4 August 2026 et que le dépôt est resté inactif depuis juin. Attendez avant de vous appuyer sur ce projet.

github.comagentic-readiness.lumar.io

Les agents qui ne s’annoncent pas

Certains agents ne publient aucun token dans robots.txt et naviguent comme un utilisateur : aucune règle User-agent ne peut donc les cibler. L’agent ChatGPT signe ses requêtes avec Web Bot Auth et envoie Signature-Agent: "https://chatgpt.com". Vous pouvez vérifier cette signature à l’aide du répertoire de clés d’OpenAI ; Cloudflare identifie ce trafic comme chatgpt-agent. Le mode Chrome local de Gemini Spark et Muse de Meta n’ont aucun signal documenté.

Questions sur les sites prêts pour les agents

Qu’est-ce qui rend un site prêt pour les agents ?

Aucun standard unique ne le définit. En pratique, cela désigne un fichier robots.txt qui nomme les bots IA selon leur rôle, des fichiers facultatifs comme llms.txt et un catalogue d’API, des versions Markdown des pages clés et un moyen de vérifier les agents auxquels vous donnez accès. Seuls robots.txt et le catalogue d’API font l’objet de RFC publiées.

Les crawlers IA lisent-ils llms.txt ?

Aucune documentation d’opérateur n’indique qu’un crawler de notre répertoire récupère ce fichier. Lighthouse vérifie s’il existe, et un agent auquel vous fournissez son URL peut le lire comme n’importe quelle autre page. Considérez-le comme une aide pratique pour les agents, pas comme une fonctionnalité de recherche.

Dois-je bloquer les crawlers IA sur mon site ?

Prenez votre décision selon le rôle du crawler, plutôt que de tout bloquer d’un coup. Vous pouvez refuser les bots d’entraînement comme GPTBot, ClaudeBot et Google-Extended sans affecter la recherche. Bloquer les bots de recherche comme OAI-SearchBot ou PerplexityBot vous exclut complètement de ces produits.

Puis-je bloquer l’agent ChatGPT avec robots.txt ?

Non, car il ne publie aucun token. Vous pouvez le reconnaître à sa signature Web Bot Auth associée à https://chatgpt.com et l’autoriser ou le refuser au niveau de votre serveur ou de votre CDN. Une signature valide prouve quel opérateur a envoyé la requête, mais pas qui est l’utilisateur ni ce qu’il est autorisé à faire.

Content-Signal est-il un standard officiel ?

Non. Il s’agit d’une politique CC0 de Cloudflare, lancée en September 2025 et publiée sur environ 3.8 millions de domaines par l’intermédiaire du fichier robots.txt géré par Cloudflare. Son projet de norme IETF a expiré le 4 April 2026, et le groupe de travail AIPREF rédige toujours un vocabulaire commun.