dotsagent.io
Ngôn ngữ:Tiếng Việt
40 crawler và agent

Danh bạ crawler và agent AI

Danh sách các bot AI mà chúng tôi xác minh được, kèm token dùng trong robots.txt, mục đích thu thập dữ liệu, thông tin về việc đơn vị vận hành có tuyên bố tuân thủ quy tắc hay không và cách xác minh yêu cầu có thực sự đến từ bot đó. Các token chỉ được biết đến qua registry ai.robots.txt của cộng đồng sẽ được ghi chú trên trang riêng của bot.

BotTokenMục đíchTuân thủ robots.txtXác minh
GPTBot
OpenAI
GPTBotHuấn luyệnCóDanh sách IP
OAI-SearchBot
OpenAI
OAI-SearchBotTìm kiếmCóDanh sách IP
ChatGPT-User
OpenAI
ChatGPT-UserLượt tải từ người dùngKhôngDanh sách IP
OAI-AdsBot
OpenAI
OAI-AdsBotQuảng cáoKhông nêu rõDanh sách IP
ChatGPT agent
OpenAI
Không có tokenAgentKhông nêu rõYêu cầu có chữ ký
ClaudeBot
Anthropic
ClaudeBotHuấn luyệnCóDanh sách IP
Claude-SearchBot
Anthropic
Claude-SearchBotTìm kiếmCóDanh sách IP
Claude-User
Anthropic
Claude-UserLượt tải từ người dùngCóDanh sách IP
Googlebot
Google
GooglebotTìm kiếmCóDanh sách IP
Google-Extended
Google
Google-ExtendedHuấn luyệnCó—
Google-CloudVertexBot
Google
Google-CloudVertexBotTìm kiếmCóDanh sách IP
GoogleOther
Google
GoogleOtherHuấn luyệnCóDanh sách IP
Google-Agent
Google
Google-AgentAgentKhôngDanh sách IP
Google-GeminiNotebook
Google
Google-GeminiNotebookLượt tải từ người dùngKhôngDanh sách IP
Gemini Spark
Google
Không có tokenAgentKhông nêu rõ—
Gemini-Deep-Research
Google
Gemini-Deep-ResearchLượt tải từ người dùngKhông nêu rõ—
GoogleAgent-Mariner
Google
GoogleAgent-MarinerAgentKhông nêu rõ—
Applebot
Apple
ApplebotTìm kiếmCóDanh sách IP
Applebot-Extended
Apple
Applebot-ExtendedHuấn luyệnCó—
PerplexityBot
Perplexity
PerplexityBotTìm kiếmCóDanh sách IP
Perplexity-User
Perplexity
Perplexity-UserLượt tải từ người dùngKhôngDanh sách IP
meta-externalagent
Meta
meta-externalagentHuấn luyệnCó—
meta-webindexer
Meta
meta-webindexerTìm kiếmCó—
meta-externalfetcher
Meta
meta-externalfetcherLượt tải từ người dùngKhông—
meta-externalads
Meta
meta-externaladsQuảng cáoCó—
facebookexternalhit
Meta
facebookexternalhitLượt tải từ người dùngKhông—
Muse
Meta
Không có tokenAgentKhông nêu rõ—
Amazonbot
Amazon
AmazonbotHuấn luyệnCóDanh sách IP
Amzn-SearchBot
Amazon
Amzn-SearchBotTìm kiếmCóDanh sách IP
Amzn-User
Amazon
Amzn-UserLượt tải từ người dùngKhôngDanh sách IP
DuckAssistBot
DuckDuckGo
DuckAssistBotTìm kiếmCóDanh sách IP
MistralAI-User
Mistral
MistralAI-UserLượt tải từ người dùngCóDanh sách IP
MistralAI-Index
Mistral
MistralAI-IndexTìm kiếmCóDanh sách IP
MistralAI-Training
Mistral
MistralAI-TrainingHuấn luyệnCó—
CCBot
Common Crawl
CCBotHuấn luyệnCóDanh sách IP
cohere-ai
Cohere
cohere-aiLượt tải từ người dùngKhông nêu rõ—
Bytespider
ByteDance
BytespiderHuấn luyệnKhông—
YouBot
You.com
YouBotTìm kiếmKhông nêu rõ—
Diffbot
Diffbot
DiffbotTìm kiếmKhông nêu rõ—
Timpibot
Timpi
TimpibotHuấn luyệnKhông nêu rõ—

Ý nghĩa của các mục đích

Huấn luyện
Thu thập trang để huấn luyện model hoặc phục vụ hoạt động crawl nghiên cứu nói chung. Google-Extended và Applebot-Extended là các token kiểm soát, bản thân chúng không gửi yêu cầu lấy dữ liệu.
Tìm kiếm
Lập chỉ mục trang cho sản phẩm tìm kiếm, từ Google Search đến các công cụ trả lời bằng AI như ChatGPT search, Perplexity và DuckAssist. Chặn bot này sẽ khiến bạn không xuất hiện trong sản phẩm tương ứng.
Lượt tải từ người dùng
Lấy trang theo yêu cầu của người dùng trong cuộc trò chuyện hoặc qua công cụ. Một số đơn vị vận hành cho biết robots.txt có thể không áp dụng cho những yêu cầu này.
Agent
Duyệt web và thực hiện thao tác thay mặt người dùng, thường bằng trình duyệt đầy đủ. Nhiều bot không có token và chỉ có thể được nhận diện bằng chữ ký, nếu có.
Quảng cáo
Kiểm tra trang đích quảng cáo do nhà quảng cáo gửi. Các bot này không có trong trình tạo robots.txt.

Xác minh bot đúng là bot tự nhận

Có thể giả mạo chuỗi user-agent mà không tốn gì. Hầu hết các nhà vận hành lớn công bố các dải IP mà bot của họ sử dụng dưới dạng tệp JSON, được đánh dấu là Danh sách IP trong bảng. Đối chiếu địa chỉ của request với danh sách tương ứng với token đó; chỉ khớp tên thì chưa đủ để xác minh.

Một số nhà vận hành cũng hướng dẫn cách xác minh DNS ngược. Chẳng hạn, Common Crawl cho biết các máy chủ CCBot phân giải thành *.crawl.commoncrawl.org; hãy xác nhận tên máy chủ phân giải ngược về cùng địa chỉ trước khi tin cậy.

Các agent ngày càng thường ký request bằng HTTP Message Signatures (RFC 9421) theo bản nháp Web Bot Auth. Request khai báo nhà vận hành trong Signature-Agent, và bạn xác minh chữ ký bằng các khóa công khai tại /.well-known/http-message-signatures-directory của miền đó. Chữ ký hợp lệ chứng minh nhà vận hành, chứ không chứng minh người dùng đứng sau request là ai hoặc người đó được phép làm gì.

Tạo robots.txt từ danh sách này →

Câu hỏi về crawler AI

Crawler AI nào bỏ qua robots.txt?

Theo tài liệu của chính nhà vận hành, ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher và facebookexternalhit có thể không tuân theo robots.txt, chủ yếu vì request được kích hoạt bởi người dùng. Cộng đồng cho biết Bytespider không tuân thủ robots.txt.

GPTBot, OAI-SearchBot và ChatGPT-User khác nhau thế nào?

GPTBot thu thập trang để huấn luyện các model OpenAI, OAI-SearchBot lập chỉ mục trang cho tính năng tìm kiếm của ChatGPT, còn ChatGPT-User truy cập trang khi có người yêu cầu. Hai bot đầu tuân theo robots.txt; OpenAI cho biết các quy tắc có thể không áp dụng cho bot thứ ba.

Agent AI nào không có token robots.txt?

ChatGPT agent, Gemini Spark và Muse của Meta. Có thể xác minh ChatGPT agent thông qua chữ ký Web Bot Auth từ https://chatgpt.com. Gemini Spark ở chế độ Chrome cục bộ trông giống trình duyệt của người dùng, còn Muse chưa công bố user-agent.

Làm sao xác minh request thực sự đến từ Googlebot?

Google công bố các dải IP của Googlebot dưới dạng tệp JSON, có liên kết trong mục tương ứng ở thư mục này. Hãy đối chiếu địa chỉ của request với các dải IP đó thay vì tin vào chuỗi user-agent.

Danh sách bot AI này lấy từ đâu?

Mỗi mục liên kết đến tài liệu của nhà vận hành nếu có; các token không có tài liệu được lấy từ registry ai.robots.txt của cộng đồng. Chúng tôi không đưa DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin và PetalBot vào danh sách vì không tìm thấy tài liệu của nhà vận hành cho các bot này. Danh sách được kiểm tra vào ngày 1 October 2026.