dotsagent.io
Język:Polski
40 crawlerów i agentów

Katalog crawlerów i agentów AI

Lista wszystkich botów AI, których istnienie udało nam się potwierdzić. Znajdziesz tu token używany w robots.txt, cel pobierania stron, deklarację operatora dotyczącą przestrzegania zasad oraz sposób weryfikacji, czy żądanie rzeczywiście pochodzi od danego bota. Tokeny znane wyłącznie z prowadzonego przez społeczność rejestru ai.robots.txt są tak oznaczone na osobnych stronach botów.

BotTokenPrzeznaczeniePrzestrzega robots.txtWeryfikacja
GPTBot
OpenAI
GPTBotTrenowanieTakLista adresów IP
OAI-SearchBot
OpenAI
OAI-SearchBotWyszukiwanieTakLista adresów IP
ChatGPT-User
OpenAI
ChatGPT-UserPobieranie przez użytkownikówNieLista adresów IP
OAI-AdsBot
OpenAI
OAI-AdsBotReklamyBrak informacjiLista adresów IP
ChatGPT agent
OpenAI
Brak tokenuAgentyBrak informacjiPodpisane żądania
ClaudeBot
Anthropic
ClaudeBotTrenowanieTakLista adresów IP
Claude-SearchBot
Anthropic
Claude-SearchBotWyszukiwanieTakLista adresów IP
Claude-User
Anthropic
Claude-UserPobieranie przez użytkownikówTakLista adresów IP
Googlebot
Google
GooglebotWyszukiwanieTakLista adresów IP
Google-Extended
Google
Google-ExtendedTrenowanieTak—
Google-CloudVertexBot
Google
Google-CloudVertexBotWyszukiwanieTakLista adresów IP
GoogleOther
Google
GoogleOtherTrenowanieTakLista adresów IP
Google-Agent
Google
Google-AgentAgentyNieLista adresów IP
Google-GeminiNotebook
Google
Google-GeminiNotebookPobieranie przez użytkownikówNieLista adresów IP
Gemini Spark
Google
Brak tokenuAgentyBrak informacji—
Gemini-Deep-Research
Google
Gemini-Deep-ResearchPobieranie przez użytkownikówBrak informacji—
GoogleAgent-Mariner
Google
GoogleAgent-MarinerAgentyBrak informacji—
Applebot
Apple
ApplebotWyszukiwanieTakLista adresów IP
Applebot-Extended
Apple
Applebot-ExtendedTrenowanieTak—
PerplexityBot
Perplexity
PerplexityBotWyszukiwanieTakLista adresów IP
Perplexity-User
Perplexity
Perplexity-UserPobieranie przez użytkownikówNieLista adresów IP
meta-externalagent
Meta
meta-externalagentTrenowanieTak—
meta-webindexer
Meta
meta-webindexerWyszukiwanieTak—
meta-externalfetcher
Meta
meta-externalfetcherPobieranie przez użytkownikówNie—
meta-externalads
Meta
meta-externaladsReklamyTak—
facebookexternalhit
Meta
facebookexternalhitPobieranie przez użytkownikówNie—
Muse
Meta
Brak tokenuAgentyBrak informacji—
Amazonbot
Amazon
AmazonbotTrenowanieTakLista adresów IP
Amzn-SearchBot
Amazon
Amzn-SearchBotWyszukiwanieTakLista adresów IP
Amzn-User
Amazon
Amzn-UserPobieranie przez użytkownikówNieLista adresów IP
DuckAssistBot
DuckDuckGo
DuckAssistBotWyszukiwanieTakLista adresów IP
MistralAI-User
Mistral
MistralAI-UserPobieranie przez użytkownikówTakLista adresów IP
MistralAI-Index
Mistral
MistralAI-IndexWyszukiwanieTakLista adresów IP
MistralAI-Training
Mistral
MistralAI-TrainingTrenowanieTak—
CCBot
Common Crawl
CCBotTrenowanieTakLista adresów IP
cohere-ai
Cohere
cohere-aiPobieranie przez użytkownikówBrak informacji—
Bytespider
ByteDance
BytespiderTrenowanieNie—
YouBot
You.com
YouBotWyszukiwanieBrak informacji—
Diffbot
Diffbot
DiffbotWyszukiwanieBrak informacji—
Timpibot
Timpi
TimpibotTrenowanieBrak informacji—

Co oznaczają poszczególne przeznaczenia

Trenowanie
Zbiera strony na potrzeby trenowania modeli lub ogólnego crawlowania badawczego. Google-Extended i Applebot-Extended to tokeny służące do kontroli dostępu — same nie pobierają żadnych danych.
Wyszukiwanie
Indeksuje strony na potrzeby wyszukiwarki — od Google Search po wyszukiwarki odpowiedzi AI, takie jak ChatGPT search, Perplexity i DuckAssist. Zablokowanie bota wyklucza stronę z danego produktu.
Pobieranie przez użytkowników
Pobiera stronę na prośbę użytkownika złożoną w czacie lub za pomocą narzędzia. Kilku operatorów informuje, że robots.txt może nie mieć zastosowania do takich żądań.
Agenty
Przegląda strony i wykonuje działania w imieniu użytkownika, często w pełnej przeglądarce. Wiele takich botów nie ma tokenu i można je rozpoznać wyłącznie na podstawie podpisu — o ile w ogóle jest to możliwe.
Reklamy
Sprawdza strony docelowe reklam przesłanych przez reklamodawców. Te boty nie są uwzględniane w generatorze robots.txt.

Sprawdź, czy bot jest tym, za kogo się podaje

Ciąg user-agent można podrobić bez żadnego wysiłku. Większość dużych operatorów publikuje zakresy adresów IP używanych przez ich boty w plikach JSON oznaczonych w tabeli jako lista adresów IP. Porównaj adres żądania z listą przypisaną do danego tokenu. Samo dopasowanie nazwy nie jest wystarczającym potwierdzeniem.

Niektórzy operatorzy dokumentują też odwrotne DNS. Common Crawl informuje na przykład, że hosty CCBot są rozwiązywane do *.crawl.commoncrawl.org. Zanim zaufasz takiemu hostowi, sprawdź, czy jego nazwa rozwiązuje się z powrotem do tego samego adresu.

Agenty coraz częściej podpisują żądania za pomocą HTTP Message Signatures (RFC 9421), zgodnie z projektem Web Bot Auth. Żądanie wskazuje operatora w polu Signature-Agent. Podpis zweryfikujesz za pomocą kluczy publicznych dostępnych pod adresem /.well-known/http-message-signatures-directory w domenie tego operatora. Prawidłowy podpis potwierdza operatora, ale nie użytkownika stojącego za żądaniem ani zakres jego uprawnień.

Utwórz robots.txt na podstawie tej listy →

Pytania o crawlery AI

Które crawlery AI ignorują robots.txt?

Zgodnie z dokumentacją ich operatorów ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher i facebookexternalhit mogą nie przestrzegać robots.txt, głównie dlatego, że pobranie strony wywołał użytkownik. Według zgłoszeń społeczności Bytespider również nie przestrzega tych reguł.

Czym różnią się GPTBot, OAI-SearchBot i ChatGPT-User?

GPTBot pobiera strony na potrzeby trenowania modeli OpenAI, OAI-SearchBot indeksuje strony dla wyszukiwarki ChatGPT, a ChatGPT-User pobiera stronę na prośbę użytkownika. Dwa pierwsze boty przestrzegają robots.txt. OpenAI informuje, że te reguły mogą nie dotyczyć trzeciego.

Które agenty AI nie mają tokenu robots.txt?

ChatGPT agent, Gemini Spark i Muse od Meta. ChatGPT agent można zweryfikować za pomocą podpisu Web Bot Auth z https://chatgpt.com. Gemini Spark w lokalnym trybie Chrome wygląda jak przeglądarka użytkownika, a Muse nie ma opublikowanego user-agenta.

Jak sprawdzić, czy żądanie naprawdę pochodzi od Googlebota?

Google publikuje zakresy adresów IP Googlebota w pliku JSON, do którego link znajduje się we wpisie Googlebota w tym katalogu. Porównaj adres żądania z tymi zakresami zamiast ufać ciągowi user-agent.

Skąd pochodzi lista botów AI?

Każdy wpis zawiera link do dokumentacji operatora, jeśli jest dostępna. Tokeny bez dokumentacji pochodzą ze społecznościowego rejestru ai.robots.txt. Pominęliśmy DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin i PetalBot, ponieważ nie znaleźliśmy dokumentacji ich operatorów. Listę sprawdzono 1 October 2026.

Niezależne źródło informacji dla osób tworzących agentów AI. Nie jesteśmy powiązani z żadnym wymienionym tu dostawcą.

© 2026 DotsAgent · Dane sprawdzone 1 października 2026