---
title: "Générateur de robots.txt pour les crawlers et agents IA · DotsAgent"
description: "Créez un robots.txt qui bloque l’entraînement des IA sans empêcher l’indexation : 35 tokens de bots classés par fonction, lignes Content-Signal, chemins privés et ligne de sitemap."
url: https://dotsagent.io/fr/agent-ready/robots-txt
---

Ouvrez votre site · générateur

# Générateur de robots.txt pour les bots IA

Choisissez une règle pour chaque type de bot IA, définissez des exceptions pour certains crawlers et copiez un fichier conforme à la RFC 9309. L’entraînement, la recherche et les récupérations déclenchées par les utilisateurs utilisent des tokens distincts : vous pouvez donc en bloquer certains et en autoriser d’autres.

`/robots.txt`

```
# Crawlers IA bloqués sur l’ensemble du site
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Crawlers IA autorisés, chemins privés exclus
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Tous les autres crawlers
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml
```

robots.txt est facultatif. ChatGPT-User, Perplexity-User et d’autres bots qui récupèrent des pages à la demande indiquent que ces règles peuvent ne pas s’appliquer à eux, et certains agents n’ont pas de token du tout. Pour imposer un blocage, comparez les requêtes aux listes d’adresses IP ou aux signatures publiées, puis refusez-les au niveau de votre pare-feu ou WAF.

[Voir tous les bots de l’annuaire →](https://dotsagent.io/fr/agent-ready/bots)

## Fonctionnement du fichier généré

### Un crawler suit son propre groupe

Un crawler qui trouve son token dans une ligne User-agent suit ce groupe et ignore les règles sous User-agent: *. C’est pourquoi le générateur répète vos chemins privés pour les bots que vous autorisez nommément et attribue un seul Disallow: / aux bots bloqués.

### Certains tokens ne servent pas au crawling

Google-Extended et Applebot-Extended n’ont pas de user-agent propre. Googlebot et Applebot effectuent le crawling, et les tokens étendus indiquent à Google et Apple si ce contenu peut servir à entraîner leurs modèles. Google applique aussi Google-Extended à l’ancrage de Gemini.

### La plupart des opérateurs séparent l’entraînement de la recherche

OpenAI, Anthropic, Amazon et Mistral utilisent chacun des tokens distincts pour l’entraînement et la recherche. Le preset No training vous permet donc de rester dans leurs produits de recherche. Meta fait exception : meta-externalagent couvre à la fois l’entraînement et l’indexation.

### Applebot utilise les règles de Googlebot par défaut

Si votre fichier ne contient aucun groupe Applebot, Apple indique qu’Applebot suit à la place vos règles Googlebot. Applebot ignore aussi Crawl-delay, tout comme Amazonbot, tandis qu’Anthropic indique que ClaudeBot le respecte.

## Questions sur robots.txt et les bots IA

### Comment bloquer GPTBot tout en restant dans la recherche de ChatGPT ?

Interdisez GPTBot et laissez OAI-SearchBot autorisé. GPTBot collecte des données d’entraînement, OAI-SearchBot indexe les pages pour la recherche de ChatGPT et ChatGPT-User gère les récupérations demandées par une personne. OpenAI documente les trois sur une même page, chacun avec sa propre liste d’adresses IP.

### Bloquer Google-Extended exclut-il mon site de Google Search ?

Google-Extended est un token de contrôle sans user-agent propre ; le crawling est effectué par Googlebot. L’interdire indique à Google de ne pas utiliser votre contenu pour l’entraînement de Gemini ni son ancrage, tandis que vos règles Googlebot déterminent ce qui est crawlé pour Search.

### Les crawlers IA respectent-ils Crawl-delay ?

Certains le respectent. Anthropic indique que ClaudeBot le respecte, tandis qu’Apple et Amazon indiquent qu’Applebot et Amazonbot ne le respectent pas. La limitation du débit sur votre serveur reste l’option la plus fiable.

### Pourquoi ChatGPT-User continue-t-il à visiter mon site après que je l’ai bloqué ?

OpenAI indique que les règles de robots.txt peuvent ne pas s’appliquer à ChatGPT-User, car une personne a demandé la page. Perplexity-User, Amzn-User et meta-externalfetcher font l’objet de réserves similaires. Si l’opérateur publie une liste d’adresses IP, comparez les requêtes à cette liste et bloquez-les au niveau de votre pare-feu.

### À quoi sert Content-Signal dans robots.txt ?

Il indique comment le contenu peut être utilisé après sa récupération, au moyen de trois signaux : search, ai-input et ai-train, chacun défini sur yes ou no. Il exprime une préférence et ne bloque rien. La fonctionnalité Markdown for Agents de Cloudflare ajoute par défaut ai-train=yes, search=yes et ai-input=yes : vérifiez donc le résultat si vous l’utilisez.

## Sources

1. [rfc-editor.org](https://www.rfc-editor.org/rfc/rfc9309)/rfc/rfc9309
2. [contentsignals.org](https://contentsignals.org/)/
3. [developers.google.com](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)/search/docs/crawling-indexing/google-common-crawlers

Référence indépendante pour les personnes qui créent des agents IA. Sans affiliation avec les fournisseurs cités.

© 2026 DotsAgent · Données vérifiées le 1 octobre 2026
