---
title: "AI 爬虫和智能体 robots.txt 生成器 · DotsAgent"
description: "生成拒绝 AI 训练、但允许搜索的 robots.txt：按用途分组的 35 个 bot token、Content-Signal 行、私有路径和 sitemap 行。"
url: https://dotsagent.io/zh/agent-ready/robots-txt
---

开放你的网站 · 生成器

# AI bot robots.txt 生成器

为每类 AI bot 选择策略，单独覆盖特定爬虫，然后复制符合 RFC 9309 的文件。训练、搜索和用户触发的抓取使用不同的 token，因此你可以拒绝其中一类，同时允许另一类。

`/robots.txt`

```
# 已屏蔽访问整个网站的 AI 爬虫
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# 允许的 AI 爬虫，排除私有路径
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# 所有其他爬虫
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml
```

robots.txt 是自愿遵守的规则。ChatGPT-User、Perplexity-User 及其他由用户触发的抓取工具表示，这些规则可能不适用于它们；有些代理甚至没有对应的 token。若要强制屏蔽，请根据公开的 IP 列表或特征匹配请求，并在防火墙或 WAF 上拒绝这些请求。

[查看目录中的所有 bot →](https://dotsagent.io/zh/agent-ready/bots)

## 生成的文件如何生效

### 爬虫遵循自己的分组

如果爬虫在 User-agent 行中找到自己的 token，就会遵循该分组，并跳过 User-agent: * 下的规则。因此，生成器会为你按名称允许的 bot 重复列出私有路径，并为已屏蔽的 bot 设置单条 Disallow: / 规则。

### 有些 token 不会执行抓取

Google-Extended 和 Applebot-Extended 没有自己的 user agent。实际抓取由 Googlebot 和 Applebot 执行；扩展 token 则告知 Google 和 Apple 是否可以使用这些内容训练模型。Google 也会将 Google-Extended 用于 Gemini grounding。

### 多数运营方会区分训练和搜索

OpenAI、Anthropic、Amazon 和 Mistral 都为训练和搜索分别设置了独立的 token，因此选择“禁止训练”预设后，你的网站仍会保留在它们的搜索产品中。Meta 是个例外：meta-externalagent 同时负责训练和索引。

### Applebot 会回退到 Googlebot 规则

如果文件中没有 Applebot 分组，Apple 表示 Applebot 会改为遵循 Googlebot 规则。Applebot 和 Amazonbot 都会忽略 Crawl-delay，而 Anthropic 表示 ClaudeBot 会遵守该规则。

## 关于 robots.txt 和 AI bot 的常见问题

### 如何屏蔽 GPTBot，同时保留 ChatGPT 搜索？

禁止 GPTBot，并允许 OAI-SearchBot。GPTBot 收集训练数据，OAI-SearchBot 为 ChatGPT 搜索索引页面，ChatGPT-User 则处理用户请求抓取的页面。OpenAI 在同一页面说明了这三者，并分别提供各自的 IP 列表。

### 屏蔽 Google-Extended 会让我的网站从 Google 搜索中消失吗？

Google-Extended 是一个没有自己 user agent 的控制 token；抓取工作由 Googlebot 执行。禁止 Google-Extended 会告知 Google 不要将你的内容用于 Gemini 训练和 grounding；哪些内容会被抓取并用于搜索，则由 Googlebot 规则决定。

### AI 爬虫会遵守 Crawl-delay 吗？

有些会。Anthropic 表示 ClaudeBot 会遵守该规则，而 Apple 和 Amazon 表示 Applebot 和 Amazonbot 不会。更可靠的做法是在服务器上进行速率限制。

### 我屏蔽了 ChatGPT-User，它为什么还会访问？

OpenAI 表示，由于页面是用户请求的，robots.txt 规则可能不适用于 ChatGPT-User。Perplexity-User、Amzn-User 和 meta-externalfetcher 也有类似说明。如果运营方公布了 IP 列表，可以根据该列表匹配请求，并在防火墙上屏蔽。

### robots.txt 中的 Content-Signal 有什么作用？

它通过三个信号说明内容抓取后可以如何使用：search、ai-input 和 ai-train，每项的值为 yes 或 no。它表达的是偏好，不会阻止任何操作。Cloudflare 的 Markdown for Agents 默认会添加 ai-train=yes、search=yes、ai-input=yes；如果启用了此功能，请检查其输出。

## 来源

1. [rfc-editor.org](https://www.rfc-editor.org/rfc/rfc9309)/rfc/rfc9309
2. [contentsignals.org](https://contentsignals.org/)/
3. [developers.google.com](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)/search/docs/crawling-indexing/google-common-crawlers

为 AI agent 开发者提供的独立参考资料。与此处提及的任何厂商均无关联。

© 2026 DotsAgent · 事实核查日期：2026年10月1日
