Direktoryo ng mga AI crawler at agent
Lahat ng AI bot na nakumpirma namin, kasama ang token na gagamitin sa robots.txt, kung ano ang kinukuha nito, kung sinasabi ng operator nito na sumusunod ito sa mga patakaran, at kung paano tiyaking mula talaga rito ang isang request. Minamarkahan sa kani-kanilang page ang mga token na alam lang mula sa community registry na ai.robots.txt.
| Bot | Token | Layunin | Sumusunod sa robots.txt | I-verify |
|---|---|---|---|---|
| GPTBot | GPTBot | Pagsasanay | Oo | Listahan ng IP |
| OAI-SearchBot | OAI-SearchBot | Paghahanap | Oo | Listahan ng IP |
| ChatGPT-User | ChatGPT-User | Mga pagkuha ng user | Hindi | Listahan ng IP |
| OAI-AdsBot | OAI-AdsBot | Mga ad | Hindi nakasaad | Listahan ng IP |
| ChatGPT agent | Walang token | Mga agent | Hindi nakasaad | Mga request na may pirma |
| ClaudeBot | ClaudeBot | Pagsasanay | Oo | Listahan ng IP |
| Claude-SearchBot | Claude-SearchBot | Paghahanap | Oo | Listahan ng IP |
| Claude-User | Claude-User | Mga pagkuha ng user | Oo | Listahan ng IP |
| Googlebot | Googlebot | Paghahanap | Oo | Listahan ng IP |
| Google-Extended | Google-Extended | Pagsasanay | Oo | — |
| Google-CloudVertexBot | Google-CloudVertexBot | Paghahanap | Oo | Listahan ng IP |
| GoogleOther | GoogleOther | Pagsasanay | Oo | Listahan ng IP |
| Google-Agent | Google-Agent | Mga agent | Hindi | Listahan ng IP |
| Google-GeminiNotebook | Google-GeminiNotebook | Mga pagkuha ng user | Hindi | Listahan ng IP |
| Gemini Spark | Walang token | Mga agent | Hindi nakasaad | — |
| Gemini-Deep-Research | Gemini-Deep-Research | Mga pagkuha ng user | Hindi nakasaad | — |
| GoogleAgent-Mariner | GoogleAgent-Mariner | Mga agent | Hindi nakasaad | — |
| Applebot | Applebot | Paghahanap | Oo | Listahan ng IP |
| Applebot-Extended | Applebot-Extended | Pagsasanay | Oo | — |
| PerplexityBot | PerplexityBot | Paghahanap | Oo | Listahan ng IP |
| Perplexity-User | Perplexity-User | Mga pagkuha ng user | Hindi | Listahan ng IP |
| meta-externalagent | meta-externalagent | Pagsasanay | Oo | — |
| meta-webindexer | meta-webindexer | Paghahanap | Oo | — |
| meta-externalfetcher | meta-externalfetcher | Mga pagkuha ng user | Hindi | — |
| meta-externalads | meta-externalads | Mga ad | Oo | — |
| facebookexternalhit | facebookexternalhit | Mga pagkuha ng user | Hindi | — |
| Muse | Walang token | Mga agent | Hindi nakasaad | — |
| Amazonbot | Amazonbot | Pagsasanay | Oo | Listahan ng IP |
| Amzn-SearchBot | Amzn-SearchBot | Paghahanap | Oo | Listahan ng IP |
| Amzn-User | Amzn-User | Mga pagkuha ng user | Hindi | Listahan ng IP |
| DuckAssistBot | DuckAssistBot | Paghahanap | Oo | Listahan ng IP |
| MistralAI-User | MistralAI-User | Mga pagkuha ng user | Oo | Listahan ng IP |
| MistralAI-Index | MistralAI-Index | Paghahanap | Oo | Listahan ng IP |
| MistralAI-Training | MistralAI-Training | Pagsasanay | Oo | — |
| CCBot | CCBot | Pagsasanay | Oo | Listahan ng IP |
| cohere-ai | cohere-ai | Mga pagkuha ng user | Hindi nakasaad | — |
| Bytespider | Bytespider | Pagsasanay | Hindi | — |
| YouBot | YouBot | Paghahanap | Hindi nakasaad | — |
| Diffbot | Diffbot | Paghahanap | Hindi nakasaad | — |
| Timpibot | Timpibot | Pagsasanay | Hindi nakasaad | — |
Ano ang ibig sabihin ng mga layunin
- Pagsasanay
- Nangongolekta ng mga page para sa training ng model o pangkalahatang pag-crawl para sa pananaliksik. Mga control token ang Google-Extended at Applebot-Extended; hindi sila kumukuha ng anuman.
- Paghahanap
- Ini-index ang mga page para sa search product, mula Google Search hanggang sa mga AI answer engine gaya ng ChatGPT search, Perplexity at DuckAssist. Kapag hinarangan mo ito, hindi mapapasama rito ang site mo.
- Mga pagkuha ng user
- Kumukuha ng page dahil hiniling ito ng isang tao sa chat o tool. Ayon sa ilang operator, maaaring hindi naaangkop ang robots.txt sa mga request na ito.
- Mga agent
- Nagba-browse at kumikilos para sa user, kadalasan gamit ang buong browser. Marami sa mga ito ang walang token at signature lang ang maaaring gamitin para makilala ang mga ito, kung mayroon man.
- Mga ad
- Sinusuri ang mga ad landing page na isinumite ng mga advertiser. Hindi kasama ang mga ito sa robots.txt generator.
Tiyaking tunay ang pagkakakilanlan ng bot
Madaling pekein ang user-agent string. Inilalathala ng karamihan sa malalaking operator ang mga IP range na ginagamit ng mga bot nila bilang mga JSON file; minarkahan ang mga ito bilang IP list sa talahanayan. Ihambing ang address ng request sa listahan para sa token na iyon. Huwag ituring na beripikado ang bot kung pangalan lang ang tumutugma.
May ilang operator ding nagdodokumento ng reverse DNS. Halimbawa, sinasabi ng Common Crawl na nagre-resolve ang mga host ng CCBot sa *.crawl.commoncrawl.org; tiyaking nagre-resolve pabalik ang hostname sa parehong address bago ito pagkatiwalaan.
Parami nang parami ang mga agent na pumipirma sa mga request gamit ang HTTP Message Signatures (RFC 9421) sa ilalim ng draft na Web Bot Auth. Tinutukoy ng request ang operator nito sa Signature-Agent, at mabe-verify mo ito gamit ang mga public key sa /.well-known/http-message-signatures-directory ng domain na iyon. Pinatutunayan ng valid na signature ang operator, hindi ang user sa likod nito o kung ano ang maaari niyang gawin.
Gumawa ng robots.txt mula sa listahang ito →
Mga tanong tungkol sa AI crawler
Aling mga AI crawler ang hindi sumusunod sa robots.txt?
Ayon sa dokumentasyon mismo ng mga operator ng mga ito, maaaring hindi sumunod dito ang ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher at facebookexternalhit, kadalasan dahil user ang nagpasimula ng pagkuha ng page. Ayon sa mga ulat ng komunidad, hindi ito sinusunod ng Bytespider.
Ano ang pagkakaiba ng GPTBot, OAI-SearchBot at ChatGPT-User?
Kumukuha ng mga page ang GPTBot para sa pagsasanay ng mga model ng OpenAI, ini-index ng OAI-SearchBot ang mga page para sa paghahanap sa ChatGPT, at kumukuha ng page ang ChatGPT-User kapag hiniling ito ng isang tao. Sumusunod sa robots.txt ang unang dalawa; ayon sa OpenAI, maaaring hindi umiral ang mga patakaran nito para sa pangatlo.
Aling mga AI agent ang walang robots.txt token?
Ang ChatGPT agent, Gemini Spark at Muse ng Meta. Mabe-verify ang ChatGPT agent gamit ang Web Bot Auth signature nito mula sa https://chatgpt.com. Sa local Chrome mode, kamukha ng sariling browser ng user ang Gemini Spark, at wala namang inilathalang user agent ang Muse.
Paano ko mabe-verify na talagang galing sa Googlebot ang isang request?
Inilalathala ng Google ang mga IP range ng Googlebot bilang JSON file, na naka-link mula sa entry nito sa direktoryong ito. Ihambing ang address ng request sa mga range na iyon sa halip na magtiwala sa user-agent string.
Saan galing ang listahang ito ng mga AI bot?
May link ang bawat entry sa dokumentasyon ng operator nito kung mayroon nito; ang mga token na walang dokumentasyon ay mula sa registry ng komunidad na ai.robots.txt. Hindi namin isinama ang DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin at PetalBot dahil wala kaming nakitang dokumentasyon mula sa mga operator ng mga ito. Sinuri ang listahan noong 1 October 2026.