Directory van AI-crawlers en agents
Elke AI-bot die we konden bevestigen, met het token voor robots.txt, waarvoor de bot gegevens ophaalt, of de operator zegt de regels te volgen en hoe je controleert of een verzoek echt van de bot afkomstig is. Tokens die alleen bekend zijn uit het ai.robots.txt-register van de community worden als zodanig vermeld op hun eigen pagina.
| Bot | Token | Doel | Volgt robots.txt | Verifiëren |
|---|---|---|---|---|
| GPTBot | GPTBot | Training | Ja | IP-lijst |
| OAI-SearchBot | OAI-SearchBot | Zoeken | Ja | IP-lijst |
| ChatGPT-User | ChatGPT-User | Ophalen door gebruikers | Nee | IP-lijst |
| OAI-AdsBot | OAI-AdsBot | Advertenties | Niet vermeld | IP-lijst |
| ChatGPT agent | Geen token | Agents | Niet vermeld | Ondertekende verzoeken |
| ClaudeBot | ClaudeBot | Training | Ja | IP-lijst |
| Claude-SearchBot | Claude-SearchBot | Zoeken | Ja | IP-lijst |
| Claude-User | Claude-User | Ophalen door gebruikers | Ja | IP-lijst |
| Googlebot | Googlebot | Zoeken | Ja | IP-lijst |
| Google-Extended | Google-Extended | Training | Ja | — |
| Google-CloudVertexBot | Google-CloudVertexBot | Zoeken | Ja | IP-lijst |
| GoogleOther | GoogleOther | Training | Ja | IP-lijst |
| Google-Agent | Google-Agent | Agents | Nee | IP-lijst |
| Google-GeminiNotebook | Google-GeminiNotebook | Ophalen door gebruikers | Nee | IP-lijst |
| Gemini Spark | Geen token | Agents | Niet vermeld | — |
| Gemini-Deep-Research | Gemini-Deep-Research | Ophalen door gebruikers | Niet vermeld | — |
| GoogleAgent-Mariner | GoogleAgent-Mariner | Agents | Niet vermeld | — |
| Applebot | Applebot | Zoeken | Ja | IP-lijst |
| Applebot-Extended | Applebot-Extended | Training | Ja | — |
| PerplexityBot | PerplexityBot | Zoeken | Ja | IP-lijst |
| Perplexity-User | Perplexity-User | Ophalen door gebruikers | Nee | IP-lijst |
| meta-externalagent | meta-externalagent | Training | Ja | — |
| meta-webindexer | meta-webindexer | Zoeken | Ja | — |
| meta-externalfetcher | meta-externalfetcher | Ophalen door gebruikers | Nee | — |
| meta-externalads | meta-externalads | Advertenties | Ja | — |
| facebookexternalhit | facebookexternalhit | Ophalen door gebruikers | Nee | — |
| Muse | Geen token | Agents | Niet vermeld | — |
| Amazonbot | Amazonbot | Training | Ja | IP-lijst |
| Amzn-SearchBot | Amzn-SearchBot | Zoeken | Ja | IP-lijst |
| Amzn-User | Amzn-User | Ophalen door gebruikers | Nee | IP-lijst |
| DuckAssistBot | DuckAssistBot | Zoeken | Ja | IP-lijst |
| MistralAI-User | MistralAI-User | Ophalen door gebruikers | Ja | IP-lijst |
| MistralAI-Index | MistralAI-Index | Zoeken | Ja | IP-lijst |
| MistralAI-Training | MistralAI-Training | Training | Ja | — |
| CCBot | CCBot | Training | Ja | IP-lijst |
| cohere-ai | cohere-ai | Ophalen door gebruikers | Niet vermeld | — |
| Bytespider | Bytespider | Training | Nee | — |
| YouBot | YouBot | Zoeken | Niet vermeld | — |
| Diffbot | Diffbot | Zoeken | Niet vermeld | — |
| Timpibot | Timpibot | Training | Niet vermeld | — |
Wat de doelen betekenen
- Training
- Verzamelt pagina's voor modeltraining of algemene research-crawling. Google-Extended en Applebot-Extended zijn control tokens die zelf nooit iets ophalen.
- Zoeken
- Indexeert pagina's voor een zoekproduct, van Google Search tot AI-antwoordmachines zoals ChatGPT search, Perplexity en DuckAssist. Als je een bot blokkeert, wordt je site niet opgenomen in dat product.
- Ophalen door gebruikers
- Haalt een pagina op omdat iemand daarom heeft gevraagd in een chat of tool. Verschillende operators geven aan dat robots.txt mogelijk niet van toepassing is op deze verzoeken.
- Agents
- Bladert namens een gebruiker door websites en voert acties uit, vaak in een volledige browser. Veel agents hebben geen token en kunnen alleen aan hun signature worden herkend, als dat al mogelijk is.
- Advertenties
- Controleert bestemmingspagina's van advertenties die door adverteerders zijn ingediend. Deze zijn weggelaten uit de robots.txt-generator.
Controleer of een bot echt is wie hij zegt te zijn
Een user-agentstring is eenvoudig te vervalsen. De meeste grote operators publiceren de IP-ranges die hun bots gebruiken als JSON-bestanden; in de tabel zijn die aangeduid als IP-lijst. Vergelijk het adres van de aanvraag met de lijst voor die token en beschouw een overeenkomst op basis van alleen de naam als niet-geverifieerd.
Sommige operators documenteren ook reverse DNS. Common Crawl vermeldt bijvoorbeeld dat hosts van CCBot verwijzen naar *.crawl.commoncrawl.org; controleer of de hostnaam terugverwijst naar hetzelfde adres voordat je de bot vertrouwt.
Agents ondertekenen aanvragen steeds vaker met HTTP Message Signatures (RFC 9421) volgens het Web Bot Auth-concept. De aanvraag vermeldt de operator in Signature-Agent. Je verifieert die met de publieke sleutels op /.well-known/http-message-signatures-directory van dat domein. Een geldige handtekening bewijst wie de operator is, niet wie de gebruiker erachter is of wat die gebruiker mag doen.
Maak een robots.txt op basis van deze lijst →
Vragen over AI-crawlers
Welke AI-crawlers negeren robots.txt?
Volgens de documentatie van hun operators volgen ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher en facebookexternalhit robots.txt mogelijk niet. Meestal komt dat doordat een gebruiker de fetch heeft gestart. Volgens meldingen uit de community houdt Bytespider zich er niet aan.
Wat is het verschil tussen GPTBot, OAI-SearchBot en ChatGPT-User?
GPTBot verzamelt pagina's om OpenAI-modellen te trainen, OAI-SearchBot indexeert pagina's voor ChatGPT Search en ChatGPT-User haalt een pagina op wanneer iemand daarom vraagt. De eerste twee volgen robots.txt; OpenAI zegt dat de regels mogelijk niet gelden voor de derde.
Welke AI-agents hebben geen robots.txt-token?
ChatGPT agent, Gemini Spark en Meta's Muse. ChatGPT agent kan worden geverifieerd via de Web Bot Auth-handtekening van https://chatgpt.com. Gemini Spark in de lokale Chrome-modus lijkt op de eigen browser van de gebruiker en Muse heeft geen gepubliceerde user-agent.
Hoe controleer ik of een aanvraag echt van Googlebot komt?
Google publiceert de IP-ranges van Googlebot als JSON-bestand, waarnaar vanuit de vermelding in deze directory wordt gelinkt. Controleer het adres van de aanvraag aan de hand van die ranges in plaats van de user-agentstring te vertrouwen.
Waar komt deze lijst met AI-bots vandaan?
Elke vermelding linkt naar de documentatie van de operator, indien beschikbaar. Tokens zonder documentatie zijn afkomstig uit het ai.robots.txt-register van de community. We hebben DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin en PetalBot weggelaten omdat we er geen documentatie van de operator voor konden vinden. De lijst is gecontroleerd op 1 October 2026.