dotsagent.io
语言:简体中文
开放你的网站 · 生成器

AI bot robots.txt 生成器

为每类 AI bot 选择策略,单独覆盖特定爬虫,然后复制符合 RFC 9309 的文件。训练、搜索和用户触发的抓取使用不同的 token,因此你可以拒绝其中一类,同时允许另一类。

从以下预设开始
训练

阻止这些 bot 可将你的页面排除在这些运营方的模型训练之外,同时不影响搜索结果中的收录。

搜索

屏蔽这些爬虫也会屏蔽 Googlebot 和 Applebot,导致你的网站无法出现在 Google 搜索以及 Apple Siri、Spotlight 和 Safari 的结果中。

用户请求

这些爬虫会在有人请求某个页面时抓取该页面,且有多个运营方表示 robots.txt 规则可能不适用于它们。因此,这里的屏蔽只是请求,并非保证。

Agent

Google-Agent 通常会忽略 robots.txt,而且大多数浏览代理根本没有对应的 token,因此这个分组在实际中影响不大。

点击 bot,即可切换它相对于所属组设置的状态。

Content-Signal
search
ai-input
ai-train

Content-Signal 用于说明抓取的页面可以如何使用:search 表示用于搜索结果,ai-input 表示用于生成 AI 答案,ai-train 表示用于模型训练。它源自 Cloudflare 的 CC0 政策,表达的是一种使用偏好,不会屏蔽任何内容。

/robots.txt
# 已屏蔽访问整个网站的 AI 爬虫
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# 允许的 AI 爬虫,排除私有路径
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# 所有其他爬虫
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

robots.txt 是自愿遵守的规则。ChatGPT-User、Perplexity-User 及其他由用户触发的抓取工具表示,这些规则可能不适用于它们;有些代理甚至没有对应的 token。若要强制屏蔽,请根据公开的 IP 列表或特征匹配请求,并在防火墙或 WAF 上拒绝这些请求。

查看目录中的所有 bot →

生成的文件如何生效

爬虫遵循自己的分组

如果爬虫在 User-agent 行中找到自己的 token,就会遵循该分组,并跳过 User-agent: * 下的规则。因此,生成器会为你按名称允许的 bot 重复列出私有路径,并为已屏蔽的 bot 设置单条 Disallow: / 规则。

有些 token 不会执行抓取

Google-Extended 和 Applebot-Extended 没有自己的 user agent。实际抓取由 Googlebot 和 Applebot 执行;扩展 token 则告知 Google 和 Apple 是否可以使用这些内容训练模型。Google 也会将 Google-Extended 用于 Gemini grounding。

多数运营方会区分训练和搜索

OpenAI、Anthropic、Amazon 和 Mistral 都为训练和搜索分别设置了独立的 token,因此选择“禁止训练”预设后,你的网站仍会保留在它们的搜索产品中。Meta 是个例外:meta-externalagent 同时负责训练和索引。

Applebot 会回退到 Googlebot 规则

如果文件中没有 Applebot 分组,Apple 表示 Applebot 会改为遵循 Googlebot 规则。Applebot 和 Amazonbot 都会忽略 Crawl-delay,而 Anthropic 表示 ClaudeBot 会遵守该规则。

关于 robots.txt 和 AI bot 的常见问题

如何屏蔽 GPTBot,同时保留 ChatGPT 搜索?

禁止 GPTBot,并允许 OAI-SearchBot。GPTBot 收集训练数据,OAI-SearchBot 为 ChatGPT 搜索索引页面,ChatGPT-User 则处理用户请求抓取的页面。OpenAI 在同一页面说明了这三者,并分别提供各自的 IP 列表。

屏蔽 Google-Extended 会让我的网站从 Google 搜索中消失吗?

Google-Extended 是一个没有自己 user agent 的控制 token;抓取工作由 Googlebot 执行。禁止 Google-Extended 会告知 Google 不要将你的内容用于 Gemini 训练和 grounding;哪些内容会被抓取并用于搜索,则由 Googlebot 规则决定。

AI 爬虫会遵守 Crawl-delay 吗?

有些会。Anthropic 表示 ClaudeBot 会遵守该规则,而 Apple 和 Amazon 表示 Applebot 和 Amazonbot 不会。更可靠的做法是在服务器上进行速率限制。

我屏蔽了 ChatGPT-User,它为什么还会访问?

OpenAI 表示,由于页面是用户请求的,robots.txt 规则可能不适用于 ChatGPT-User。Perplexity-User、Amzn-User 和 meta-externalfetcher 也有类似说明。如果运营方公布了 IP 列表,可以根据该列表匹配请求,并在防火墙上屏蔽。

robots.txt 中的 Content-Signal 有什么作用?

它通过三个信号说明内容抓取后可以如何使用:search、ai-input 和 ai-train,每项的值为 yes 或 no。它表达的是偏好,不会阻止任何操作。Cloudflare 的 Markdown for Agents 默认会添加 ai-train=yes、search=yes、ai-input=yes;如果启用了此功能,请检查其输出。

来源

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers

为 AI agent 开发者提供的独立参考资料。与此处提及的任何厂商均无关联。

© 2026 DotsAgent · 事实核查日期:2026年10月1日