---
title: "Tạo robots.txt cho crawler và agent AI · DotsAgent"
description: "Tạo robots.txt để từ chối AI dùng dữ liệu huấn luyện nhưng vẫn cho phép tìm kiếm: 35 bot token được nhóm theo mục đích, các dòng Content-Signal, đường dẫn riêng tư và dòng sitemap."
url: https://dotsagent.io/vi/agent-ready/robots-txt
---

Mở trang web · công cụ tạo

# Tạo robots.txt cho bot AI

Chọn chính sách cho từng loại bot AI, đặt ngoại lệ cho từng crawler rồi sao chép tệp tuân thủ RFC 9309. Bot dùng để huấn luyện, tìm kiếm và tải nội dung theo yêu cầu của người dùng có token riêng, nên bạn có thể từ chối loại này và cho phép loại khác.

`/robots.txt`

```
# Đã chặn crawler AI trên toàn bộ trang web
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Cho phép crawler AI, ngoại trừ các đường dẫn riêng tư
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Tất cả crawler khác
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml
```

robots.txt hoạt động theo nguyên tắc tự nguyện. ChatGPT-User, Perplexity-User và các bot khác được kích hoạt theo yêu cầu của người dùng cho biết các quy tắc có thể không áp dụng với họ; một số agent thậm chí không có token. Để thực thi việc chặn, hãy đối chiếu request với danh sách IP hoặc chữ ký đã công bố, rồi từ chối chúng tại firewall hoặc WAF.

[Xem toàn bộ bot trong danh bạ →](https://dotsagent.io/vi/agent-ready/bots)

## Cách tệp được tạo hoạt động

### Crawler tuân theo nhóm riêng

Crawler tìm thấy token của mình trong dòng User-agent sẽ tuân theo nhóm đó và bỏ qua các quy tắc bên dưới User-agent: *. Vì vậy, trình tạo lặp lại các đường dẫn riêng tư cho những bot được cho phép theo tên, đồng thời đặt một quy tắc Disallow: / duy nhất cho các bot bị chặn.

### Một số token không trực tiếp crawl

Google-Extended và Applebot-Extended không có user agent riêng. Googlebot và Applebot thực hiện việc tải trang; các token mở rộng cho Google và Apple biết liệu nội dung đó có thể được dùng để huấn luyện model hay không. Google cũng áp dụng Google-Extended cho việc grounding trong Gemini.

### Hầu hết nhà vận hành tách riêng việc huấn luyện và tìm kiếm

OpenAI, Anthropic, Amazon và Mistral đều dùng token riêng cho việc huấn luyện và tìm kiếm, vì vậy preset No training vẫn cho phép nội dung xuất hiện trong các sản phẩm tìm kiếm của họ. Meta là ngoại lệ: meta-externalagent dùng cho cả huấn luyện lẫn lập chỉ mục.

### Applebot dùng quy tắc của Googlebot nếu không có nhóm riêng

Apple cho biết nếu tệp của bạn không có nhóm Applebot, Applebot sẽ tuân theo quy tắc Googlebot. Applebot cũng bỏ qua Crawl-delay, tương tự Amazonbot, trong khi Anthropic cho biết ClaudeBot tuân thủ quy tắc này.

## Câu hỏi về robots.txt và bot AI

### Làm cách nào chặn GPTBot mà vẫn xuất hiện trong tìm kiếm ChatGPT?

Đặt Disallow cho GPTBot và vẫn cho phép OAI-SearchBot. GPTBot thu thập dữ liệu huấn luyện, OAI-SearchBot lập chỉ mục trang cho tính năng tìm kiếm của ChatGPT, còn ChatGPT-User xử lý các lượt tải trang theo yêu cầu của người dùng. OpenAI mô tả cả ba trên cùng một trang, mỗi bot có danh sách IP riêng.

### Chặn Google-Extended có khiến trang web của tôi biến mất khỏi Google Search không?

Google-Extended là token điều khiển, không có user agent riêng; Googlebot mới là bot crawl. Đặt Disallow cho token này sẽ yêu cầu Google không dùng nội dung của bạn để huấn luyện và grounding cho Gemini, còn quy tắc Googlebot sẽ quyết định những gì được crawl cho Search.

### Crawler AI có tuân thủ Crawl-delay không?

Một số có. Anthropic cho biết ClaudeBot tuân thủ quy tắc này, còn Apple và Amazon cho biết Applebot và Amazonbot thì không. Giới hạn tốc độ ở máy chủ là lựa chọn đáng tin cậy hơn.

### Tại sao ChatGPT-User vẫn truy cập sau khi tôi chặn bot này?

OpenAI cho biết quy tắc robots.txt có thể không áp dụng với ChatGPT-User vì bot này tải trang theo yêu cầu của người dùng. Perplexity-User, Amzn-User và meta-externalfetcher cũng có lưu ý tương tự. Nếu nhà vận hành công bố danh sách IP, hãy đối chiếu request với danh sách đó và chặn tại firewall.

### Content-Signal trong robots.txt có tác dụng gì?

Nội dung này nêu cách sử dụng nội dung sau khi được truy xuất, thông qua ba tín hiệu: search, ai-input và ai-train, mỗi tín hiệu được đặt thành yes hoặc no. Đây chỉ là lựa chọn ưu tiên, không chặn bất cứ điều gì. Cloudflare's Markdown for Agents mặc định thêm ai-train=yes, search=yes, ai-input=yes, vì vậy hãy kiểm tra kết quả nếu bạn dùng tính năng này.

## Nguồn

1. [rfc-editor.org](https://www.rfc-editor.org/rfc/rfc9309)/rfc/rfc9309
2. [contentsignals.org](https://contentsignals.org/)/
3. [developers.google.com](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)/search/docs/crawling-indexing/google-common-crawlers

Tài liệu tham khảo độc lập dành cho những người xây dựng AI agent. Không liên kết với bất kỳ nhà cung cấp nào được nêu ở đây.

© 2026 DotsAgent · Dữ liệu được kiểm tra ngày 1 tháng 10, 2026
