---
title: "Répertoire des bots IA : 40 crawlers, tokens et listes d’adresses IP · DotsAgent"
description: "40 crawlers et agents IA d’OpenAI, Anthropic, Google, Apple, Meta, Amazon et d’autres, avec leur jeton robots.txt, leur objectif, leur conformité et leur liste d’adresses IP."
url: https://dotsagent.io/fr/agent-ready/bots
---

40 crawlers et agents

# Répertoire des crawlers et agents IA

Tous les bots IA que nous avons pu confirmer, avec le jeton à utiliser dans robots.txt, leur objectif, la déclaration de leur opérateur sur le respect des règles et les moyens de vérifier qu’une requête provient bien de ce bot. Les jetons connus uniquement grâce au registre communautaire ai.robots.txt sont signalés sur leurs pages respectives.

| Bot | Jeton | Objectif | Respecte robots.txt | Vérification |
| --- | --- | --- | --- | --- |
| [GPTBot](https://dotsagent.io/fr/agent-ready/bots/gptbot)OpenAI | `GPTBot` | Entraînement | — | Liste d’adresses IP |
| [OAI-SearchBot](https://dotsagent.io/fr/agent-ready/bots/oai-searchbot)OpenAI | `OAI-SearchBot` | Recherche | — | Liste d’adresses IP |
| [ChatGPT-User](https://dotsagent.io/fr/agent-ready/bots/chatgpt-user)OpenAI | `ChatGPT-User` | Requêtes utilisateur | — | Liste d’adresses IP |
| [OAI-AdsBot](https://dotsagent.io/fr/agent-ready/bots/oai-adsbot)OpenAI | `OAI-AdsBot` | Publicités | — | Liste d’adresses IP |
| [ChatGPT agent](https://dotsagent.io/fr/agent-ready/bots/chatgpt-agent)OpenAI | Aucun jeton | Agents | — | Requêtes signées |
| [ClaudeBot](https://dotsagent.io/fr/agent-ready/bots/claudebot)Anthropic | `ClaudeBot` | Entraînement | — | Liste d’adresses IP |
| [Claude-SearchBot](https://dotsagent.io/fr/agent-ready/bots/claude-searchbot)Anthropic | `Claude-SearchBot` | Recherche | — | Liste d’adresses IP |
| [Claude-User](https://dotsagent.io/fr/agent-ready/bots/claude-user)Anthropic | `Claude-User` | Requêtes utilisateur | — | Liste d’adresses IP |
| [Googlebot](https://dotsagent.io/fr/agent-ready/bots/googlebot)Google | `Googlebot` | Recherche | — | Liste d’adresses IP |
| [Google-Extended](https://dotsagent.io/fr/agent-ready/bots/google-extended)Google | `Google-Extended` | Entraînement | — | — |
| [Google-CloudVertexBot](https://dotsagent.io/fr/agent-ready/bots/google-cloudvertexbot)Google | `Google-CloudVertexBot` | Recherche | — | Liste d’adresses IP |
| [GoogleOther](https://dotsagent.io/fr/agent-ready/bots/googleother)Google | `GoogleOther` | Entraînement | — | Liste d’adresses IP |
| [Google-Agent](https://dotsagent.io/fr/agent-ready/bots/google-agent)Google | `Google-Agent` | Agents | — | Liste d’adresses IP |
| [Google-GeminiNotebook](https://dotsagent.io/fr/agent-ready/bots/google-gemininotebook)Google | `Google-GeminiNotebook` | Requêtes utilisateur | — | Liste d’adresses IP |
| [Gemini Spark](https://dotsagent.io/fr/agent-ready/bots/gemini-spark)Google | Aucun jeton | Agents | — | — |
| [Gemini-Deep-Research](https://dotsagent.io/fr/agent-ready/bots/gemini-deep-research)Google | `Gemini-Deep-Research` | Requêtes utilisateur | — | — |
| [GoogleAgent-Mariner](https://dotsagent.io/fr/agent-ready/bots/googleagent-mariner)Google | `GoogleAgent-Mariner` | Agents | — | — |
| [Applebot](https://dotsagent.io/fr/agent-ready/bots/applebot)Apple | `Applebot` | Recherche | — | Liste d’adresses IP |
| [Applebot-Extended](https://dotsagent.io/fr/agent-ready/bots/applebot-extended)Apple | `Applebot-Extended` | Entraînement | — | — |
| [PerplexityBot](https://dotsagent.io/fr/agent-ready/bots/perplexitybot)Perplexity | `PerplexityBot` | Recherche | — | Liste d’adresses IP |
| [Perplexity-User](https://dotsagent.io/fr/agent-ready/bots/perplexity-user)Perplexity | `Perplexity-User` | Requêtes utilisateur | — | Liste d’adresses IP |
| [meta-externalagent](https://dotsagent.io/fr/agent-ready/bots/meta-externalagent)Meta | `meta-externalagent` | Entraînement | — | — |
| [meta-webindexer](https://dotsagent.io/fr/agent-ready/bots/meta-webindexer)Meta | `meta-webindexer` | Recherche | — | — |
| [meta-externalfetcher](https://dotsagent.io/fr/agent-ready/bots/meta-externalfetcher)Meta | `meta-externalfetcher` | Requêtes utilisateur | — | — |
| [meta-externalads](https://dotsagent.io/fr/agent-ready/bots/meta-externalads)Meta | `meta-externalads` | Publicités | — | — |
| [facebookexternalhit](https://dotsagent.io/fr/agent-ready/bots/facebookexternalhit)Meta | `facebookexternalhit` | Requêtes utilisateur | — | — |
| [Muse](https://dotsagent.io/fr/agent-ready/bots/muse)Meta | Aucun jeton | Agents | — | — |
| [Amazonbot](https://dotsagent.io/fr/agent-ready/bots/amazonbot)Amazon | `Amazonbot` | Entraînement | — | Liste d’adresses IP |
| [Amzn-SearchBot](https://dotsagent.io/fr/agent-ready/bots/amzn-searchbot)Amazon | `Amzn-SearchBot` | Recherche | — | Liste d’adresses IP |
| [Amzn-User](https://dotsagent.io/fr/agent-ready/bots/amzn-user)Amazon | `Amzn-User` | Requêtes utilisateur | — | Liste d’adresses IP |
| [DuckAssistBot](https://dotsagent.io/fr/agent-ready/bots/duckassistbot)DuckDuckGo | `DuckAssistBot` | Recherche | — | Liste d’adresses IP |
| [MistralAI-User](https://dotsagent.io/fr/agent-ready/bots/mistralai-user)Mistral | `MistralAI-User` | Requêtes utilisateur | — | Liste d’adresses IP |
| [MistralAI-Index](https://dotsagent.io/fr/agent-ready/bots/mistralai-index)Mistral | `MistralAI-Index` | Recherche | — | Liste d’adresses IP |
| [MistralAI-Training](https://dotsagent.io/fr/agent-ready/bots/mistralai-training)Mistral | `MistralAI-Training` | Entraînement | — | — |
| [CCBot](https://dotsagent.io/fr/agent-ready/bots/ccbot)Common Crawl | `CCBot` | Entraînement | — | Liste d’adresses IP |
| [cohere-ai](https://dotsagent.io/fr/agent-ready/bots/cohere-ai)Cohere | `cohere-ai` | Requêtes utilisateur | — | — |
| [Bytespider](https://dotsagent.io/fr/agent-ready/bots/bytespider)ByteDance | `Bytespider` | Entraînement | — | — |
| [YouBot](https://dotsagent.io/fr/agent-ready/bots/youbot)You.com | `YouBot` | Recherche | — | — |
| [Diffbot](https://dotsagent.io/fr/agent-ready/bots/diffbot)Diffbot | `Diffbot` | Recherche | — | — |
| [Timpibot](https://dotsagent.io/fr/agent-ready/bots/timpibot)Timpi | `Timpibot` | Entraînement | — | — |

## Signification des objectifs

- **Entraînement**: Collecte des pages pour entraîner des modèles ou effectuer du crawling à des fins de recherche générale. Google-Extended et Applebot-Extended sont des jetons de contrôle qui ne récupèrent jamais de contenu eux-mêmes.
- **Recherche**: Indexe des pages pour un produit de recherche, de Google Search aux moteurs de réponse IA comme la recherche ChatGPT, Perplexity et DuckAssist. Le bloquer vous exclut de ce produit.
- **Requêtes utilisateur**: Récupère une page à la demande d’une personne depuis un chat ou un outil. Plusieurs opérateurs indiquent que robots.txt peut ne pas s’appliquer à ces requêtes.
- **Agents**: Navigue et agit pour le compte d’un utilisateur, souvent dans un navigateur complet. Beaucoup n’ont pas de jeton et ne peuvent être identifiés que par leur signature, le cas échéant.
- **Publicités**: Vérifie les pages de destination publicitaires soumises par les annonceurs. Ces bots sont exclus du générateur robots.txt.

## Vérifier l’identité d’un bot

Une chaîne user-agent est facile à falsifier. La plupart des grands opérateurs publient sous forme de fichiers JSON les plages d’adresses IP utilisées par leurs bots ; le tableau les signale par « liste d’adresses IP ». Comparez l’adresse de la requête à la liste correspondant à ce token, et ne considérez pas une correspondance sur le seul nom comme vérifiée.

Certains opérateurs documentent aussi le DNS inverse. Common Crawl indique par exemple que les hôtes CCBot ont un nom d’hôte qui se résout en *.crawl.commoncrawl.org ; vérifiez que ce nom d’hôte se résout à nouveau vers la même adresse avant de lui faire confiance.

Les agents signent de plus en plus leurs requêtes avec HTTP Message Signatures (RFC 9421), selon le brouillon Web Bot Auth. La requête indique l’opérateur dans Signature-Agent ; vérifiez la signature à l’aide des clés publiques disponibles dans /.well-known/http-message-signatures-directory sur le domaine concerné. Une signature valide prouve l’identité de l’opérateur, pas celle de l’utilisateur ni les actions qu’il est autorisé à effectuer.

[Générer un robots.txt à partir de cette liste →](https://dotsagent.io/fr/agent-ready/robots-txt)

## Questions sur les crawlers IA

### Quels crawlers IA ignorent robots.txt ?

D’après la documentation de leurs opérateurs, ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher et facebookexternalhit peuvent ne pas respecter robots.txt, principalement parce que la récupération est déclenchée par un utilisateur. Selon la communauté, Bytespider ne le respecte pas.

### Quelle est la différence entre GPTBot, OAI-SearchBot et ChatGPT-User ?

GPTBot collecte des pages pour entraîner les modèles OpenAI, OAI-SearchBot indexe des pages pour la recherche ChatGPT et ChatGPT-User récupère une page à la demande d’une personne. Les deux premiers respectent robots.txt ; OpenAI précise que ses règles peuvent ne pas s’appliquer au troisième.

### Quels agents IA n’ont pas de token robots.txt ?

ChatGPT agent, Gemini Spark et Muse de Meta. ChatGPT agent peut être vérifié à l’aide de sa signature Web Bot Auth provenant de https://chatgpt.com. En mode Chrome local, Gemini Spark ressemble au navigateur de l’utilisateur, et Muse n’a pas de user-agent publié.

### Comment vérifier qu’une requête provient bien de Googlebot ?

Google publie les plages d’adresses IP de Googlebot dans un fichier JSON, accessible depuis son entrée dans cet annuaire. Vérifiez que l’adresse de la requête figure dans ces plages au lieu de vous fier à la chaîne user-agent.

### D’où vient cette liste de bots IA ?

Chaque entrée renvoie vers la documentation de l’opérateur lorsqu’elle existe ; les tokens non documentés proviennent du registre communautaire ai.robots.txt. Nous avons exclu DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin et PetalBot, car nous n’avons trouvé aucune documentation de leurs opérateurs. La liste a été vérifiée le 1 octobre 2026.

Référence indépendante pour les personnes qui créent des agents IA. Sans affiliation avec les fournisseurs cités.

© 2026 DotsAgent · Données vérifiées le 1 octobre 2026
