dotsagent.io
Ngôn ngữ:Tiếng Việt
Mở website của bạn · tài liệu tham khảo

Giúp agent AI đọc được website của bạn

Crawler và agent AI đọc website của bạn khác với con người. Các công cụ dưới đây tạo những tệp mà chúng tìm kiếm; phần tài liệu tham khảo bên dưới cho biết quy ước nào là tiêu chuẩn, quy ước nào vẫn là bản nháp và có bao nhiêu client thực sự sử dụng chúng.

Các quy ước và mức độ ổn định của chúng

Trạng thái tính đến tháng 10 năm 2026. Mỗi mục liên kết đến đặc tả hoặc bằng chứng liên quan để bạn tự đánh giá mức độ cần thiết đối với website của mình.

robots.txt Tiêu chuẩn

Tệp đặt ở thư mục gốc của website dùng token để xác định crawler và liệt kê những đường dẫn mà mỗi crawler nên bỏ qua; định dạng này được chuẩn hóa trong RFC 9309. Các đơn vị vận hành AI hiện công bố token riêng cho việc huấn luyện, tìm kiếm và tải nội dung theo yêu cầu của người dùng. Vì vậy, một tệp duy nhất có thể chặn việc huấn luyện mà vẫn cho phép tìm kiếm. Việc tuân thủ là tự nguyện; một số trình tải nội dung theo yêu cầu của người dùng cho biết các quy tắc này có thể không áp dụng với họ.

/robots.txt
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

platform.openai.comdevelopers.google.com

Content-Signal Được sử dụng rộng rãi

Một dòng bổ sung trong robots.txt, nêu rõ cách được phép sử dụng nội dung đã thu thập: search, ai-input và ai-train, mỗi mục được đặt là yes hoặc no. Cloudflare phát hành chính sách này theo giấy phép CC0 vào tháng 9 năm 2025 và cung cấp chính sách trên khoảng 3.8 triệu tên miền thông qua robots.txt do họ quản lý. Bản dự thảo IETF tương ứng đã hết hạn vào ngày 4 April 2026, còn nhóm công tác AIPREF của IETF tiếp tục xây dựng bản dự thảo từ vựng.

/robots.txt
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /

blog.cloudflare.comdatatracker.ietf.org

llms.txt Đề xuất

Một tệp Markdown tại /llms.txt, gồm tên H1, phần tóm tắt dạng blockquote và các mục H2 chứa liên kết, giúp agent truy cập những trang quan trọng mà không cần phân tích thanh điều hướng. Đặc tả tại llmstxt.org được sửa đổi vào ngày 10 August 2026; llms-full.txt không thuộc đặc tả này. Chúng tôi chưa có tuyên bố nào từ đơn vị vận hành cho biết crawler lớn nào đọc tệp này.

/llms.txt
# Acme API

> Card payments for small online shops.

## Docs

- [Quickstart](https://example.com/docs/quickstart.md): first request

llmstxt.orgllmstxt.org

Phiên bản Markdown của trang Áp dụng một phần

Xuất bản bản Markdown của từng trang tại page.md hoặc page.html.md, hoặc trả về Markdown cho mọi yêu cầu có header Accept yêu cầu text/markdown. Trong thử nghiệm tháng 2 năm 2026 của Checkly, Claude Code, Cursor và OpenCode gửi header này, còn Codex, Gemini CLI, GitHub Copilot và Windsurf thì không. AnswerShare ghi nhận 1,277,965 yêu cầu từ các crawler tiên tiến nhất; không yêu cầu nào trong số đó yêu cầu Markdown.

Request
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdown

developers.cloudflare.comchecklyhq.comanswershare.com

Danh mục API Tiêu chuẩn

RFC 9727, được công bố vào tháng 6 năm 2025, dành riêng /.well-known/api-catalog cho danh sách các API công khai của bạn. Mỗi API liên kết đến mô tả ở định dạng máy có thể đọc, tài liệu và trang trạng thái. Phản hồi phải có kiểu application/linkset+json; các trang khác có thể trỏ đến danh mục này bằng quan hệ liên kết api-catalog.

/.well-known/api-catalog
{
  "linkset": [
    {
      "anchor": "https://api.example.com/v1",
      "service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
    }
  ]
}

rfc-editor.org

Yêu cầu đã ký của agent (Web Bot Auth) Bản dự thảo

Agent ký từng yêu cầu bằng HTTP Message Signatures (RFC 9421) và nêu tên đơn vị vận hành trong header Signature-Agent. Bạn kiểm tra chữ ký dựa trên các khóa mà đơn vị vận hành đó công bố tại /.well-known/http-message-signatures-directory. Bản dự thảo của nhóm công tác IETF có từ ngày 1 September 2026; agent ChatGPT hiện đã ký yêu cầu với tên https://chatgpt.com, còn Google đang thử nghiệm https://agent.bot.goog.

Request header
Signature-Agent: "https://chatgpt.com"

datatracker.ietf.orgblog.cloudflare.com

NLWeb Đình trệ

NLWeb của Microsoft cung cấp cho website các endpoint /ask và /mcp để agent truy vấn bằng ngôn ngữ tự nhiên; đặc tả hiện ở phiên bản 0.55. Lumar cho biết chứng chỉ của nlweb.ai đã hết hạn vào ngày 4 August 2026 và repository không có hoạt động mới kể từ tháng 6, vì vậy hãy chờ trước khi xây dựng dựa trên công nghệ này.

github.comagentic-readiness.lumar.io

Các agent không tự nhận diện

Một số agent không công bố token trong robots.txt và duyệt web như người dùng, nên không thể áp dụng quy tắc User-agent cho chúng. Agent ChatGPT ký các request bằng Web Bot Auth và gửi Signature-Agent: "https://chatgpt.com"; bạn có thể đối chiếu chữ ký này với thư mục khóa của OpenAI. Cloudflare gắn nhãn lưu lượng này là chatgpt-agent. Gemini Spark ở chế độ Chrome cục bộ và Muse của Meta hoàn toàn không có tín hiệu nào được tài liệu hóa.

Câu hỏi về website sẵn sàng cho agent

Điều gì giúp một website sẵn sàng cho agent?

Không có tiêu chuẩn chung nào định nghĩa điều này. Trên thực tế, một website sẵn sàng cho agent có robots.txt liệt kê các bot AI theo mục đích, các tệp tùy chọn như llms.txt và danh mục API, phiên bản Markdown của những trang quan trọng, cùng cách xác minh các agent được phép truy cập. Trong số này, chỉ robots.txt và danh mục API là các RFC đã được công bố.

Crawler AI có đọc llms.txt không?

Chúng tôi chưa tìm thấy tài liệu nào từ các đơn vị vận hành cho biết crawler trong danh mục của chúng tôi tải tệp này. Lighthouse kiểm tra xem tệp có tồn tại hay không; agent được bạn trỏ đến tệp có thể đọc nó như mọi trang khác. Hãy xem đây là tiện ích dành cho agent, không phải tính năng tìm kiếm.

Tôi có nên chặn crawler AI trên website không?

Hãy quyết định theo từng mục đích, thay vì chặn tất cả cùng lúc. Bạn có thể từ chối các token dùng cho huấn luyện như GPTBot, ClaudeBot và Google-Extended mà không ảnh hưởng đến tìm kiếm. Chặn các token tìm kiếm như OAI-SearchBot hoặc PerplexityBot sẽ khiến website của bạn hoàn toàn không xuất hiện trong các sản phẩm đó.

Tôi có thể chặn agent ChatGPT bằng robots.txt không?

Không, vì agent này không công bố token. Bạn có thể nhận diện nó qua chữ ký Web Bot Auth từ https://chatgpt.com, rồi cho phép hoặc từ chối request tại máy chủ hoặc CDN. Chữ ký hợp lệ xác minh đơn vị vận hành đã gửi request, chứ không xác minh người dùng là ai hoặc họ được phép làm gì.

Content-Signal có phải là tiêu chuẩn chính thức không?

Không. Đây là chính sách CC0 của Cloudflare, ra mắt vào tháng 9 năm 2025 và được phân phát trên khoảng 3.8 triệu miền thông qua robots.txt do Cloudflare quản lý. Bản nháp IETF của chính sách này đã hết hạn vào ngày 4 April 2026, còn nhóm công tác AIPREF vẫn đang soạn thảo một bộ từ vựng chung.