Rendez votre site lisible par les agents IA
Les crawlers et agents IA ne lisent pas votre site comme les humains. Les outils ci-dessous génèrent les fichiers qu’ils recherchent ; la référence qui suit indique quelles conventions sont des standards, lesquelles sont des brouillons et combien de clients les utilisent réellement.
Générateur llms.txt
Saisissez un nom, un résumé et des sections de liens, puis copiez un fichier au format llmstxt.org.
robots.txt pour les bots IA
Définissez une règle par usage des bots, activez ou désactivez chaque crawler, ajoutez Content-Signal et téléchargez le résultat.
Catalogue d’API
Répertoriez vos API avec leurs fichiers OpenAPI et leur documentation, puis obtenez un linkset RFC 9727 et un bloc nginx pour le publier.
Répertoire des bots IA
40 crawlers et agents avec leurs tokens, leurs usages, leur comportement vis-à-vis de robots.txt et leurs listes d’adresses IP publiées.
Les conventions et leur degré de maturité
État en octobre 2026. Chaque entrée renvoie vers la spécification ou les éléments qui l’étayent, pour vous aider à évaluer ce qui vaut la peine d’être mis en place sur votre site.
robots.txt Standard
Le fichier placé à la racine de votre site désigne les crawlers par token et répertorie les chemins que chacun doit ignorer ; son format est normalisé par la RFC 9309. Les opérateurs d’IA publient désormais des tokens distincts pour l’entraînement, la recherche et les récupérations déclenchées par l’utilisateur. Un seul fichier peut donc refuser l’entraînement tout en autorisant la recherche. Le respect des règles est volontaire, et plusieurs robots de récupération déclenchée par l’utilisateur indiquent qu’elles peuvent ne pas s’appliquer à eux.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal Largement utilisé
Une ligne supplémentaire dans robots.txt qui précise comment le contenu récupéré peut être utilisé : search, ai-input et ai-train, avec la valeur yes ou no pour chacun. Cloudflare l’a publiée sous licence CC0 en septembre 2025 et la sert sur environ 3.8 millions de domaines via son robots.txt géré. Le projet de l’IETF correspondant a expiré le 4 avril 2026, mais le groupe de travail AIPREF de l’IETF poursuit ses travaux sur un projet de vocabulaire.
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt Proposition
Un fichier Markdown à l’adresse /llms.txt, contenant un titre H1, un résumé en citation et des sections H2 avec des liens, pour permettre à un agent d’accéder à vos pages clés sans analyser la navigation. La spécification sur llmstxt.org a été révisée le 10 août 2026, et llms-full.txt n’en fait pas partie. Aucun opérateur n’a déclaré que son crawler lisait ce fichier.
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestVersions Markdown des pages Adoption partielle
Publiez une copie Markdown de chaque page à l’adresse page.md ou page.html.md, ou renvoyez du Markdown pour toute requête dont l’en-tête Accept demande text/markdown. Lors du test de Checkly en février 2026, Claude Code, Cursor et OpenCode ont envoyé cet en-tête, contrairement à Codex, Gemini CLI, GitHub Copilot et Windsurf. AnswerShare a comptabilisé 1,277,965 requêtes de crawlers de pointe ; aucune ne demandait du Markdown.
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownCatalogue d’API Norme
La RFC 9727, publiée en juin 2025, réserve /.well-known/api-catalog à la liste de vos API publiques. Chaque API renvoie à sa description lisible par machine, à sa documentation et à sa page d’état. La réponse doit être au format application/linkset+json, et d’autres pages peuvent y renvoyer à l’aide de la relation de lien api-catalog.
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}Requêtes d’agent signées (Web Bot Auth) Projet
Les agents signent chaque requête à l’aide des signatures de messages HTTP (RFC 9421) et indiquent le nom de leur opérateur dans un en-tête Signature-Agent. Vous vérifiez la signature à l’aide des clés publiées par cet opérateur sous /.well-known/http-message-signatures-directory. Le projet du groupe de travail de l’IETF date du 1 septembre 2026 ; l’agent ChatGPT signe déjà ses requêtes avec https://chatgpt.com, et Google expérimente avec https://agent.bot.goog.
Signature-Agent: "https://chatgpt.com"NLWeb À l’arrêt
NLWeb de Microsoft fournit à un site les endpoints /ask et /mcp, que les agents peuvent interroger en langage naturel. Sa spécification est en version 0.55. Lumar signale que le certificat de nlweb.ai a expiré le 4 August 2026 et que le dépôt est resté inactif depuis juin. Attendez avant de vous appuyer sur ce projet.
Les agents qui ne s’annoncent pas
Certains agents ne publient aucun token dans robots.txt et naviguent comme un utilisateur : aucune règle User-agent ne peut donc les cibler. L’agent ChatGPT signe ses requêtes avec Web Bot Auth et envoie Signature-Agent: "https://chatgpt.com". Vous pouvez vérifier cette signature à l’aide du répertoire de clés d’OpenAI ; Cloudflare identifie ce trafic comme chatgpt-agent. Le mode Chrome local de Gemini Spark et Muse de Meta n’ont aucun signal documenté.
Questions sur les sites prêts pour les agents
Qu’est-ce qui rend un site prêt pour les agents ?
Aucun standard unique ne le définit. En pratique, cela désigne un fichier robots.txt qui nomme les bots IA selon leur rôle, des fichiers facultatifs comme llms.txt et un catalogue d’API, des versions Markdown des pages clés et un moyen de vérifier les agents auxquels vous donnez accès. Seuls robots.txt et le catalogue d’API font l’objet de RFC publiées.
Les crawlers IA lisent-ils llms.txt ?
Aucune documentation d’opérateur n’indique qu’un crawler de notre répertoire récupère ce fichier. Lighthouse vérifie s’il existe, et un agent auquel vous fournissez son URL peut le lire comme n’importe quelle autre page. Considérez-le comme une aide pratique pour les agents, pas comme une fonctionnalité de recherche.
Dois-je bloquer les crawlers IA sur mon site ?
Prenez votre décision selon le rôle du crawler, plutôt que de tout bloquer d’un coup. Vous pouvez refuser les bots d’entraînement comme GPTBot, ClaudeBot et Google-Extended sans affecter la recherche. Bloquer les bots de recherche comme OAI-SearchBot ou PerplexityBot vous exclut complètement de ces produits.
Puis-je bloquer l’agent ChatGPT avec robots.txt ?
Non, car il ne publie aucun token. Vous pouvez le reconnaître à sa signature Web Bot Auth associée à https://chatgpt.com et l’autoriser ou le refuser au niveau de votre serveur ou de votre CDN. Une signature valide prouve quel opérateur a envoyé la requête, mais pas qui est l’utilisateur ni ce qu’il est autorisé à faire.
Content-Signal est-il un standard officiel ?
Non. Il s’agit d’une politique CC0 de Cloudflare, lancée en September 2025 et publiée sur environ 3.8 millions de domaines par l’intermédiaire du fichier robots.txt géré par Cloudflare. Son projet de norme IETF a expiré le 4 April 2026, et le groupe de travail AIPREF rédige toujours un vocabulaire commun.