dotsagent.io
Sprache:Deutsch
Website öffnen · Generator

robots.txt-Generator für KI-Bots

Wählen Sie eine Richtlinie für jede Art von KI-Bot, legen Sie Ausnahmen für einzelne Crawler fest und kopieren Sie eine Datei gemäß RFC 9309. Für Training, Suche und nutzergesteuerte Abrufe gelten unterschiedliche Tokens. So können Sie eine Art blockieren und eine andere zulassen.

Ausgangspunkt
Training

Wenn Sie diese Bots blockieren, schließen Sie Ihre Seiten vom Modelltraining dieser Anbieter aus, ohne Ihre Suchergebnisse zu beeinflussen.

Suche

Wenn Sie auch diese blockieren, blockieren Sie Googlebot und Applebot. Ihre Website erscheint dann nicht mehr in der Google-Suche und in den Ergebnissen von Siri, Spotlight und Safari.

Nutzerabrufe

Diese Bots rufen eine Seite ab, weil eine Person sie angefordert hat. Mehrere Betreiber weisen darauf hin, dass robots.txt möglicherweise nicht für sie gilt. Eine Sperre ist daher eine Bitte, keine Garantie.

Agents

Google-Agent ignoriert robots.txt im Allgemeinen, und die meisten Browser-Agenten haben überhaupt keinen Token. Diese Gruppe ändert daher in der Praxis wenig.

Klicken Sie auf einen Bot, um seine Einstellung gegenüber der Vorgabe seiner Gruppe umzukehren.

Content-Signal
search
ai-input
ai-train

Content-Signal legt fest, wie abgerufene Seiten verwendet werden dürfen: search für Suchergebnisse, ai-input für die Bereitstellung von KI-Antworten und ai-train für das Modelltraining. Es stammt aus Cloudflares CC0-Richtlinie und drückt eine Präferenz aus, ohne etwas zu blockieren.

/robots.txt
# KI-Crawler für die gesamte Website blockiert
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# KI-Crawler zugelassen, private Pfade ausgenommen
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Alle anderen Crawler
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

robots.txt ist freiwillig. ChatGPT-User, Perplexity-User und andere durch Nutzer ausgelöste Abrufdienste weisen darauf hin, dass die Regeln möglicherweise nicht für sie gelten. Manche Agenten haben überhaupt keinen Token. Um eine Sperre durchzusetzen, gleichen Sie Anfragen mit veröffentlichten IP-Listen oder Signaturen ab und weisen Sie sie an Ihrer Firewall oder WAF zurück.

Alle Bots im Verzeichnis ansehen →

So funktioniert die generierte Datei

Crawler folgen ihrer eigenen Gruppe

Findet ein Crawler seinen Token in einer User-agent-Zeile, folgt er dieser Gruppe und überspringt die Regeln unter User-agent: *. Deshalb wiederholt der Generator Ihre privaten Pfade für die Bots, die Sie namentlich zulassen, und weist blockierten Bots ein einziges Disallow: / zu.

Manche Tokens crawlen nie

Google-Extended und Applebot-Extended haben keinen eigenen User-Agent. Googlebot und Applebot rufen die Inhalte ab. Die erweiterten Tokens teilen Google und Apple mit, ob diese Inhalte zum Training ihrer Modelle verwendet werden dürfen. Google wendet Google-Extended außerdem auf die Gemini-Grundlagenverankerung an.

Die meisten Betreiber trennen Training und Suche

OpenAI, Anthropic, Amazon und Mistral verwenden jeweils separate Tokens für Training und Suche. Mit der Voreinstellung „Kein Training“ bleiben Sie deshalb in ihren Suchprodukten vertreten. Meta ist die Ausnahme: meta-externalagent deckt sowohl Training als auch Indexierung ab.

Applebot greift auf Googlebot-Regeln zurück

Enthält Ihre Datei keine Applebot-Gruppe, folgt Applebot laut Apple stattdessen Ihren Googlebot-Regeln. Applebot und Amazonbot ignorieren außerdem Crawl-delay, während Anthropic angibt, dass ClaudeBot diese Regel berücksichtigt.

Fragen zu robots.txt und KI-Bots

Wie blockiere ich GPTBot und bleibe trotzdem in der ChatGPT-Suche?

Sperren Sie GPTBot und lassen Sie OAI-SearchBot zu. GPTBot sammelt Trainingsdaten, OAI-SearchBot indexiert Seiten für die ChatGPT-Suche, und ChatGPT-User ruft Seiten ab, die eine Person angefordert hat. OpenAI dokumentiert alle drei auf einer Seite und führt für jeden eine eigene IP-Liste.

Wird meine Website aus der Google-Suche entfernt, wenn ich Google-Extended blockiere?

Google-Extended ist ein Steuerungs-Token ohne eigenen User-Agent; das Crawling übernimmt Googlebot. Wenn Sie Google-Extended sperren, weisen Sie Google an, Ihre Inhalte nicht für das Gemini-Training und die Grundlagenverankerung zu verwenden. Ihre Googlebot-Regeln legen weiterhin fest, welche Inhalte für die Suche gecrawlt werden.

Halten sich KI-Crawler an Crawl-delay?

Manche schon. Anthropic gibt an, dass ClaudeBot die Regel berücksichtigt. Apple und Amazon erklären dagegen, dass Applebot und Amazonbot dies nicht tun. Eine Ratenbegrenzung auf Ihrem Server ist die zuverlässige Lösung.

Warum ruft ChatGPT-User meine Website weiterhin auf, obwohl ich den Bot blockiert habe?

OpenAI weist darauf hin, dass robots.txt möglicherweise nicht für ChatGPT-User gilt, da eine Person die Seite angefordert hat. Für Perplexity-User, Amzn-User und meta-externalfetcher gelten ähnliche Einschränkungen. Wenn der Betreiber eine IP-Liste veröffentlicht, gleichen Sie Anfragen damit ab und blockieren Sie sie an Ihrer Firewall.

Was bewirkt Content-Signal in robots.txt?

Sie legt anhand von drei Signalen fest, wie Inhalte nach dem Abruf verwendet werden dürfen: search, ai-input und ai-train. Für jedes Signal ist yes oder no angegeben. Sie drückt eine Präferenz aus und blockiert nichts. Cloudflare's Markdown for Agents setzt standardmäßig ai-train=yes, search=yes und ai-input=yes. Prüfen Sie daher die Ausgabe, wenn Sie diese Funktion verwenden.

Quellen

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers