Katalog crawlerów i agentów AI
Lista wszystkich botów AI, których istnienie udało nam się potwierdzić. Znajdziesz tu token używany w robots.txt, cel pobierania stron, deklarację operatora dotyczącą przestrzegania zasad oraz sposób weryfikacji, czy żądanie rzeczywiście pochodzi od danego bota. Tokeny znane wyłącznie z prowadzonego przez społeczność rejestru ai.robots.txt są tak oznaczone na osobnych stronach botów.
| Bot | Token | Przeznaczenie | Przestrzega robots.txt | Weryfikacja |
|---|---|---|---|---|
| GPTBot | GPTBot | Trenowanie | Tak | Lista adresów IP |
| OAI-SearchBot | OAI-SearchBot | Wyszukiwanie | Tak | Lista adresów IP |
| ChatGPT-User | ChatGPT-User | Pobieranie przez użytkowników | Nie | Lista adresów IP |
| OAI-AdsBot | OAI-AdsBot | Reklamy | Brak informacji | Lista adresów IP |
| ChatGPT agent | Brak tokenu | Agenty | Brak informacji | Podpisane żądania |
| ClaudeBot | ClaudeBot | Trenowanie | Tak | Lista adresów IP |
| Claude-SearchBot | Claude-SearchBot | Wyszukiwanie | Tak | Lista adresów IP |
| Claude-User | Claude-User | Pobieranie przez użytkowników | Tak | Lista adresów IP |
| Googlebot | Googlebot | Wyszukiwanie | Tak | Lista adresów IP |
| Google-Extended | Google-Extended | Trenowanie | Tak | — |
| Google-CloudVertexBot | Google-CloudVertexBot | Wyszukiwanie | Tak | Lista adresów IP |
| GoogleOther | GoogleOther | Trenowanie | Tak | Lista adresów IP |
| Google-Agent | Google-Agent | Agenty | Nie | Lista adresów IP |
| Google-GeminiNotebook | Google-GeminiNotebook | Pobieranie przez użytkowników | Nie | Lista adresów IP |
| Gemini Spark | Brak tokenu | Agenty | Brak informacji | — |
| Gemini-Deep-Research | Gemini-Deep-Research | Pobieranie przez użytkowników | Brak informacji | — |
| GoogleAgent-Mariner | GoogleAgent-Mariner | Agenty | Brak informacji | — |
| Applebot | Applebot | Wyszukiwanie | Tak | Lista adresów IP |
| Applebot-Extended | Applebot-Extended | Trenowanie | Tak | — |
| PerplexityBot | PerplexityBot | Wyszukiwanie | Tak | Lista adresów IP |
| Perplexity-User | Perplexity-User | Pobieranie przez użytkowników | Nie | Lista adresów IP |
| meta-externalagent | meta-externalagent | Trenowanie | Tak | — |
| meta-webindexer | meta-webindexer | Wyszukiwanie | Tak | — |
| meta-externalfetcher | meta-externalfetcher | Pobieranie przez użytkowników | Nie | — |
| meta-externalads | meta-externalads | Reklamy | Tak | — |
| facebookexternalhit | facebookexternalhit | Pobieranie przez użytkowników | Nie | — |
| Muse | Brak tokenu | Agenty | Brak informacji | — |
| Amazonbot | Amazonbot | Trenowanie | Tak | Lista adresów IP |
| Amzn-SearchBot | Amzn-SearchBot | Wyszukiwanie | Tak | Lista adresów IP |
| Amzn-User | Amzn-User | Pobieranie przez użytkowników | Nie | Lista adresów IP |
| DuckAssistBot | DuckAssistBot | Wyszukiwanie | Tak | Lista adresów IP |
| MistralAI-User | MistralAI-User | Pobieranie przez użytkowników | Tak | Lista adresów IP |
| MistralAI-Index | MistralAI-Index | Wyszukiwanie | Tak | Lista adresów IP |
| MistralAI-Training | MistralAI-Training | Trenowanie | Tak | — |
| CCBot | CCBot | Trenowanie | Tak | Lista adresów IP |
| cohere-ai | cohere-ai | Pobieranie przez użytkowników | Brak informacji | — |
| Bytespider | Bytespider | Trenowanie | Nie | — |
| YouBot | YouBot | Wyszukiwanie | Brak informacji | — |
| Diffbot | Diffbot | Wyszukiwanie | Brak informacji | — |
| Timpibot | Timpibot | Trenowanie | Brak informacji | — |
Co oznaczają poszczególne przeznaczenia
- Trenowanie
- Zbiera strony na potrzeby trenowania modeli lub ogólnego crawlowania badawczego. Google-Extended i Applebot-Extended to tokeny służące do kontroli dostępu — same nie pobierają żadnych danych.
- Wyszukiwanie
- Indeksuje strony na potrzeby wyszukiwarki — od Google Search po wyszukiwarki odpowiedzi AI, takie jak ChatGPT search, Perplexity i DuckAssist. Zablokowanie bota wyklucza stronę z danego produktu.
- Pobieranie przez użytkowników
- Pobiera stronę na prośbę użytkownika złożoną w czacie lub za pomocą narzędzia. Kilku operatorów informuje, że robots.txt może nie mieć zastosowania do takich żądań.
- Agenty
- Przegląda strony i wykonuje działania w imieniu użytkownika, często w pełnej przeglądarce. Wiele takich botów nie ma tokenu i można je rozpoznać wyłącznie na podstawie podpisu — o ile w ogóle jest to możliwe.
- Reklamy
- Sprawdza strony docelowe reklam przesłanych przez reklamodawców. Te boty nie są uwzględniane w generatorze robots.txt.
Sprawdź, czy bot jest tym, za kogo się podaje
Ciąg user-agent można podrobić bez żadnego wysiłku. Większość dużych operatorów publikuje zakresy adresów IP używanych przez ich boty w plikach JSON oznaczonych w tabeli jako lista adresów IP. Porównaj adres żądania z listą przypisaną do danego tokenu. Samo dopasowanie nazwy nie jest wystarczającym potwierdzeniem.
Niektórzy operatorzy dokumentują też odwrotne DNS. Common Crawl informuje na przykład, że hosty CCBot są rozwiązywane do *.crawl.commoncrawl.org. Zanim zaufasz takiemu hostowi, sprawdź, czy jego nazwa rozwiązuje się z powrotem do tego samego adresu.
Agenty coraz częściej podpisują żądania za pomocą HTTP Message Signatures (RFC 9421), zgodnie z projektem Web Bot Auth. Żądanie wskazuje operatora w polu Signature-Agent. Podpis zweryfikujesz za pomocą kluczy publicznych dostępnych pod adresem /.well-known/http-message-signatures-directory w domenie tego operatora. Prawidłowy podpis potwierdza operatora, ale nie użytkownika stojącego za żądaniem ani zakres jego uprawnień.
Utwórz robots.txt na podstawie tej listy →
Pytania o crawlery AI
Które crawlery AI ignorują robots.txt?
Zgodnie z dokumentacją ich operatorów ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher i facebookexternalhit mogą nie przestrzegać robots.txt, głównie dlatego, że pobranie strony wywołał użytkownik. Według zgłoszeń społeczności Bytespider również nie przestrzega tych reguł.
Czym różnią się GPTBot, OAI-SearchBot i ChatGPT-User?
GPTBot pobiera strony na potrzeby trenowania modeli OpenAI, OAI-SearchBot indeksuje strony dla wyszukiwarki ChatGPT, a ChatGPT-User pobiera stronę na prośbę użytkownika. Dwa pierwsze boty przestrzegają robots.txt. OpenAI informuje, że te reguły mogą nie dotyczyć trzeciego.
Które agenty AI nie mają tokenu robots.txt?
ChatGPT agent, Gemini Spark i Muse od Meta. ChatGPT agent można zweryfikować za pomocą podpisu Web Bot Auth z https://chatgpt.com. Gemini Spark w lokalnym trybie Chrome wygląda jak przeglądarka użytkownika, a Muse nie ma opublikowanego user-agenta.
Jak sprawdzić, czy żądanie naprawdę pochodzi od Googlebota?
Google publikuje zakresy adresów IP Googlebota w pliku JSON, do którego link znajduje się we wpisie Googlebota w tym katalogu. Porównaj adres żądania z tymi zakresami zamiast ufać ciągowi user-agent.
Skąd pochodzi lista botów AI?
Każdy wpis zawiera link do dokumentacji operatora, jeśli jest dostępna. Tokeny bez dokumentacji pochodzą ze społecznościowego rejestru ai.robots.txt. Pominęliśmy DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin i PetalBot, ponieważ nie znaleźliśmy dokumentacji ich operatorów. Listę sprawdzono 1 October 2026.