dotsagent.io
Sprache:Deutsch
40 Crawler und Agents

Verzeichnis für AI-Crawler und -Agents

Alle AI-Bots, die wir bestätigen konnten – mit dem Token für robots.txt, dem Zweck ihrer Abrufe, den Angaben ihrer Betreiber zur Einhaltung der Regeln und Hinweisen dazu, wie Sie überprüfen können, ob eine Anfrage tatsächlich von diesem Bot stammt. Tokens, die nur aus dem Community-Register ai.robots.txt bekannt sind, sind auf den jeweiligen Seiten entsprechend gekennzeichnet.

BotTokenZweckBefolgt robots.txtÜberprüfen
GPTBot
OpenAI
GPTBotTrainingJaIP-Liste
OAI-SearchBot
OpenAI
OAI-SearchBotSucheJaIP-Liste
ChatGPT-User
OpenAI
ChatGPT-UserNutzerabrufeNeinIP-Liste
OAI-AdsBot
OpenAI
OAI-AdsBotWerbungKeine AngabeIP-Liste
ChatGPT agent
OpenAI
Kein TokenAgentsKeine AngabeSignierte Anfragen
ClaudeBot
Anthropic
ClaudeBotTrainingJaIP-Liste
Claude-SearchBot
Anthropic
Claude-SearchBotSucheJaIP-Liste
Claude-User
Anthropic
Claude-UserNutzerabrufeJaIP-Liste
Googlebot
Google
GooglebotSucheJaIP-Liste
Google-Extended
Google
Google-ExtendedTrainingJa—
Google-CloudVertexBot
Google
Google-CloudVertexBotSucheJaIP-Liste
GoogleOther
Google
GoogleOtherTrainingJaIP-Liste
Google-Agent
Google
Google-AgentAgentsNeinIP-Liste
Google-GeminiNotebook
Google
Google-GeminiNotebookNutzerabrufeNeinIP-Liste
Gemini Spark
Google
Kein TokenAgentsKeine Angabe—
Gemini-Deep-Research
Google
Gemini-Deep-ResearchNutzerabrufeKeine Angabe—
GoogleAgent-Mariner
Google
GoogleAgent-MarinerAgentsKeine Angabe—
Applebot
Apple
ApplebotSucheJaIP-Liste
Applebot-Extended
Apple
Applebot-ExtendedTrainingJa—
PerplexityBot
Perplexity
PerplexityBotSucheJaIP-Liste
Perplexity-User
Perplexity
Perplexity-UserNutzerabrufeNeinIP-Liste
meta-externalagent
Meta
meta-externalagentTrainingJa—
meta-webindexer
Meta
meta-webindexerSucheJa—
meta-externalfetcher
Meta
meta-externalfetcherNutzerabrufeNein—
meta-externalads
Meta
meta-externaladsWerbungJa—
facebookexternalhit
Meta
facebookexternalhitNutzerabrufeNein—
Muse
Meta
Kein TokenAgentsKeine Angabe—
Amazonbot
Amazon
AmazonbotTrainingJaIP-Liste
Amzn-SearchBot
Amazon
Amzn-SearchBotSucheJaIP-Liste
Amzn-User
Amazon
Amzn-UserNutzerabrufeNeinIP-Liste
DuckAssistBot
DuckDuckGo
DuckAssistBotSucheJaIP-Liste
MistralAI-User
Mistral
MistralAI-UserNutzerabrufeJaIP-Liste
MistralAI-Index
Mistral
MistralAI-IndexSucheJaIP-Liste
MistralAI-Training
Mistral
MistralAI-TrainingTrainingJa—
CCBot
Common Crawl
CCBotTrainingJaIP-Liste
cohere-ai
Cohere
cohere-aiNutzerabrufeKeine Angabe—
Bytespider
ByteDance
BytespiderTrainingNein—
YouBot
You.com
YouBotSucheKeine Angabe—
Diffbot
Diffbot
DiffbotSucheKeine Angabe—
Timpibot
Timpi
TimpibotTrainingKeine Angabe—

Was die einzelnen Zwecke bedeuten

Training
Sammelt Seiten für das Modelltraining oder allgemeines Research-Crawling. Google-Extended und Applebot-Extended sind Steuerungs-Tokens und rufen selbst niemals Inhalte ab.
Suche
Indexiert Seiten für ein Suchprodukt – von Google Search bis hin zu AI-Antwortdiensten wie ChatGPT search, Perplexity und DuckAssist. Wenn Sie den Bot blockieren, wird Ihre Website in diesem Produkt nicht angezeigt.
Nutzerabrufe
Ruft eine Seite ab, weil eine Person in einem Chat oder Tool darum gebeten hat. Mehrere Betreiber geben an, dass robots.txt für solche Anfragen möglicherweise nicht gilt.
Agents
Navigiert im Auftrag eines Nutzers und führt Aktionen aus, häufig in einem vollständigen Browser. Viele haben kein Token und lassen sich, wenn überhaupt, nur anhand ihrer Signatur erkennen.
Werbung
Überprüft Landingpages von Anzeigen, die Werbetreibende eingereicht haben. Diese Bots sind im robots.txt-Generator nicht enthalten.

Prüfen, ob ein Bot wirklich der ist, für den er sich ausgibt

Ein User-Agent-String lässt sich kostenlos fälschen. Die meisten großen Betreiber veröffentlichen die IP-Bereiche ihrer Bots als JSON-Dateien, die in der Tabelle als IP-Liste gekennzeichnet sind. Vergleichen Sie die Adresse der Anfrage mit der Liste für diesen Token und behandeln Sie einen Treffer allein anhand des Namens als nicht verifiziert.

Einige Betreiber dokumentieren außerdem Reverse DNS. Common Crawl gibt beispielsweise an, dass CCBot-Hosts zu *.crawl.commoncrawl.org aufgelöst werden. Vergewissern Sie sich, dass der Hostname wieder auf dieselbe Adresse aufgelöst wird, bevor Sie ihm vertrauen.

Agents signieren Anfragen zunehmend mit HTTP Message Signatures (RFC 9421) gemäß dem Web Bot Auth-Entwurf. Die Anfrage nennt den Betreiber in Signature-Agent. Prüfen Sie die Signatur mit den öffentlichen Schlüsseln unter /.well-known/http-message-signatures-directory der betreffenden Domain. Eine gültige Signatur bestätigt den Betreiber, nicht die Person hinter der Anfrage oder deren Berechtigungen.

Aus dieser Liste eine robots.txt erstellen →

Fragen zu KI-Crawlern

Welche KI-Crawler ignorieren robots.txt?

Laut der Dokumentation ihrer Betreiber halten sich ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher und facebookexternalhit möglicherweise nicht daran, meist weil ein Nutzer den Abruf ausgelöst hat. Berichten aus der Community zufolge hält sich Bytespider ebenfalls nicht daran.

Was ist der Unterschied zwischen GPTBot, OAI-SearchBot und ChatGPT-User?

GPTBot sammelt Seiten für das Training von OpenAI-Modellen, OAI-SearchBot indexiert Seiten für die ChatGPT-Suche und ChatGPT-User ruft eine Seite ab, wenn eine Person danach fragt. Die ersten beiden halten sich an robots.txt. OpenAI zufolge gelten die Regeln möglicherweise nicht für den dritten.

Welche KI-Agents haben keinen robots.txt-Token?

ChatGPT agent, Gemini Spark und Meta's Muse. ChatGPT agent lässt sich anhand seiner Web Bot Auth-Signatur von https://chatgpt.com verifizieren. Gemini Spark sieht im lokalen Chrome-Modus aus wie der Browser des Nutzers, und für Muse ist kein User-Agent veröffentlicht.

Wie prüfe ich, ob eine Anfrage wirklich von Googlebot kommt?

Google veröffentlicht die IP-Bereiche von Googlebot als JSON-Datei, die im Eintrag dieses Verzeichnisses verlinkt ist. Vergleichen Sie die Adresse der Anfrage mit diesen Bereichen, statt dem User-Agent-String zu vertrauen.

Woher stammt diese Liste der KI-Bots?

Jeder Eintrag verlinkt, sofern vorhanden, auf die Dokumentation des Betreibers. Tokens ohne solche Dokumentation stammen aus dem Community-Register ai.robots.txt. DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin und PetalBot haben wir weggelassen, da wir keine Dokumentation ihrer Betreiber gefunden haben. Die Liste wurde am 1. Oktober 2026 überprüft.