dotsagent.io
Langue:Français
40 crawlers et agents

Répertoire des crawlers et agents IA

Tous les bots IA que nous avons pu confirmer, avec le jeton à utiliser dans robots.txt, leur objectif, la déclaration de leur opérateur sur le respect des règles et les moyens de vérifier qu’une requête provient bien de ce bot. Les jetons connus uniquement grâce au registre communautaire ai.robots.txt sont signalés sur leurs pages respectives.

BotJetonObjectifRespecte robots.txtVérification
GPTBot
OpenAI
GPTBotEntraînementOuiListe d’adresses IP
OAI-SearchBot
OpenAI
OAI-SearchBotRechercheOuiListe d’adresses IP
ChatGPT-User
OpenAI
ChatGPT-UserRequêtes utilisateurNonListe d’adresses IP
OAI-AdsBot
OpenAI
OAI-AdsBotPublicitésNon préciséListe d’adresses IP
ChatGPT agent
OpenAI
Aucun jetonAgentsNon préciséRequêtes signées
ClaudeBot
Anthropic
ClaudeBotEntraînementOuiListe d’adresses IP
Claude-SearchBot
Anthropic
Claude-SearchBotRechercheOuiListe d’adresses IP
Claude-User
Anthropic
Claude-UserRequêtes utilisateurOuiListe d’adresses IP
Googlebot
Google
GooglebotRechercheOuiListe d’adresses IP
Google-Extended
Google
Google-ExtendedEntraînementOui—
Google-CloudVertexBot
Google
Google-CloudVertexBotRechercheOuiListe d’adresses IP
GoogleOther
Google
GoogleOtherEntraînementOuiListe d’adresses IP
Google-Agent
Google
Google-AgentAgentsNonListe d’adresses IP
Google-GeminiNotebook
Google
Google-GeminiNotebookRequêtes utilisateurNonListe d’adresses IP
Gemini Spark
Google
Aucun jetonAgentsNon précisé—
Gemini-Deep-Research
Google
Gemini-Deep-ResearchRequêtes utilisateurNon précisé—
GoogleAgent-Mariner
Google
GoogleAgent-MarinerAgentsNon précisé—
Applebot
Apple
ApplebotRechercheOuiListe d’adresses IP
Applebot-Extended
Apple
Applebot-ExtendedEntraînementOui—
PerplexityBot
Perplexity
PerplexityBotRechercheOuiListe d’adresses IP
Perplexity-User
Perplexity
Perplexity-UserRequêtes utilisateurNonListe d’adresses IP
meta-externalagent
Meta
meta-externalagentEntraînementOui—
meta-webindexer
Meta
meta-webindexerRechercheOui—
meta-externalfetcher
Meta
meta-externalfetcherRequêtes utilisateurNon—
meta-externalads
Meta
meta-externaladsPublicitésOui—
facebookexternalhit
Meta
facebookexternalhitRequêtes utilisateurNon—
Muse
Meta
Aucun jetonAgentsNon précisé—
Amazonbot
Amazon
AmazonbotEntraînementOuiListe d’adresses IP
Amzn-SearchBot
Amazon
Amzn-SearchBotRechercheOuiListe d’adresses IP
Amzn-User
Amazon
Amzn-UserRequêtes utilisateurNonListe d’adresses IP
DuckAssistBot
DuckDuckGo
DuckAssistBotRechercheOuiListe d’adresses IP
MistralAI-User
Mistral
MistralAI-UserRequêtes utilisateurOuiListe d’adresses IP
MistralAI-Index
Mistral
MistralAI-IndexRechercheOuiListe d’adresses IP
MistralAI-Training
Mistral
MistralAI-TrainingEntraînementOui—
CCBot
Common Crawl
CCBotEntraînementOuiListe d’adresses IP
cohere-ai
Cohere
cohere-aiRequêtes utilisateurNon précisé—
Bytespider
ByteDance
BytespiderEntraînementNon—
YouBot
You.com
YouBotRechercheNon précisé—
Diffbot
Diffbot
DiffbotRechercheNon précisé—
Timpibot
Timpi
TimpibotEntraînementNon précisé—

Signification des objectifs

Entraînement
Collecte des pages pour entraîner des modèles ou effectuer du crawling à des fins de recherche générale. Google-Extended et Applebot-Extended sont des jetons de contrôle qui ne récupèrent jamais de contenu eux-mêmes.
Recherche
Indexe des pages pour un produit de recherche, de Google Search aux moteurs de réponse IA comme la recherche ChatGPT, Perplexity et DuckAssist. Le bloquer vous exclut de ce produit.
Requêtes utilisateur
Récupère une page à la demande d’une personne depuis un chat ou un outil. Plusieurs opérateurs indiquent que robots.txt peut ne pas s’appliquer à ces requêtes.
Agents
Navigue et agit pour le compte d’un utilisateur, souvent dans un navigateur complet. Beaucoup n’ont pas de jeton et ne peuvent être identifiés que par leur signature, le cas échéant.
Publicités
Vérifie les pages de destination publicitaires soumises par les annonceurs. Ces bots sont exclus du générateur robots.txt.

Vérifier l’identité d’un bot

Une chaîne user-agent est facile à falsifier. La plupart des grands opérateurs publient sous forme de fichiers JSON les plages d’adresses IP utilisées par leurs bots ; le tableau les signale par « liste d’adresses IP ». Comparez l’adresse de la requête à la liste correspondant à ce token, et ne considérez pas une correspondance sur le seul nom comme vérifiée.

Certains opérateurs documentent aussi le DNS inverse. Common Crawl indique par exemple que les hôtes CCBot ont un nom d’hôte qui se résout en *.crawl.commoncrawl.org ; vérifiez que ce nom d’hôte se résout à nouveau vers la même adresse avant de lui faire confiance.

Les agents signent de plus en plus leurs requêtes avec HTTP Message Signatures (RFC 9421), selon le brouillon Web Bot Auth. La requête indique l’opérateur dans Signature-Agent ; vérifiez la signature à l’aide des clés publiques disponibles dans /.well-known/http-message-signatures-directory sur le domaine concerné. Une signature valide prouve l’identité de l’opérateur, pas celle de l’utilisateur ni les actions qu’il est autorisé à effectuer.

Générer un robots.txt à partir de cette liste →

Questions sur les crawlers IA

Quels crawlers IA ignorent robots.txt ?

D’après la documentation de leurs opérateurs, ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher et facebookexternalhit peuvent ne pas respecter robots.txt, principalement parce que la récupération est déclenchée par un utilisateur. Selon la communauté, Bytespider ne le respecte pas.

Quelle est la différence entre GPTBot, OAI-SearchBot et ChatGPT-User ?

GPTBot collecte des pages pour entraîner les modèles OpenAI, OAI-SearchBot indexe des pages pour la recherche ChatGPT et ChatGPT-User récupère une page à la demande d’une personne. Les deux premiers respectent robots.txt ; OpenAI précise que ses règles peuvent ne pas s’appliquer au troisième.

Quels agents IA n’ont pas de token robots.txt ?

ChatGPT agent, Gemini Spark et Muse de Meta. ChatGPT agent peut être vérifié à l’aide de sa signature Web Bot Auth provenant de https://chatgpt.com. En mode Chrome local, Gemini Spark ressemble au navigateur de l’utilisateur, et Muse n’a pas de user-agent publié.

Comment vérifier qu’une requête provient bien de Googlebot ?

Google publie les plages d’adresses IP de Googlebot dans un fichier JSON, accessible depuis son entrée dans cet annuaire. Vérifiez que l’adresse de la requête figure dans ces plages au lieu de vous fier à la chaîne user-agent.

D’où vient cette liste de bots IA ?

Chaque entrée renvoie vers la documentation de l’opérateur lorsqu’elle existe ; les tokens non documentés proviennent du registre communautaire ai.robots.txt. Nous avons exclu DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin et PetalBot, car nous n’avons trouvé aucune documentation de leurs opérateurs. La liste a été vérifiée le 1 octobre 2026.