dotsagent.io
Język:Polski
Otwórz swoją witrynę · generator

Generator robots.txt dla botów AI

Wybierz zasady dla każdego rodzaju bota AI, ustaw wyjątki dla poszczególnych crawlerów i skopiuj plik zgodny z RFC 9309. Boty używają osobnych tokenów do trenowania, wyszukiwania i pobierania treści na żądanie użytkownika, więc możesz zablokować jedne i zezwolić na działanie innych.

Punkt wyjścia
Trenowanie

Zablokowanie tych botów wyklucza Twoje strony z trenowania modeli przez obsługujących je operatorów, nie wpływając na wyniki wyszukiwania.

Wyszukiwanie

Zablokowanie tych botów zablokuje też Googlebot i Applebot, przez co Twoja witryna zniknie z wyników Google Search oraz Siri, Spotlight i Safari od Apple.

Pobieranie przez użytkowników

Pobierają stronę na prośbę użytkownika. Kilku operatorów twierdzi, że zasady robots.txt mogą ich nie dotyczyć, więc blokada jest tu prośbą, a nie gwarancją.

Agenty

Google-Agent zazwyczaj ignoruje robots.txt, a większość agentów przeglądających strony nie ma własnego tokena, więc ta grupa niewiele zmienia w praktyce.

Kliknij bota, aby zmienić jego ustawienie na przeciwne do ustawienia grupy.

Content-Signal
search
ai-input
ai-train

Content-Signal określa, jak można wykorzystywać pobrane strony: search — w wynikach wyszukiwania, ai-input — do generowania odpowiedzi AI, a ai-train — do trenowania modeli. Sygnał pochodzi z polityki Cloudflare na licencji CC0 i wyraża preferencje, ale niczego nie blokuje.

/robots.txt
# Boty AI zablokowane w całej witrynie
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Dozwolone boty AI; ścieżki prywatne wykluczone
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Wszystkie pozostałe boty
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

robots.txt działa na zasadzie dobrowolności. ChatGPT-User, Perplexity-User i inne boty pobierające strony na żądanie użytkownika twierdzą, że te zasady mogą ich nie dotyczyć, a niektóre agenty nie mają własnego tokena. Aby wymusić blokadę, porównuj żądania z opublikowanymi listami adresów IP lub sygnaturami i blokuj je na firewallu albo WAF.

Zobacz wszystkie boty w katalogu →

Jak działa wygenerowany plik

Bot stosuje zasady ze swojej grupy

Bot, który znajdzie swój token w wierszu User-agent, stosuje zasady z tej grupy i pomija zasady w sekcji User-agent: *. Dlatego generator powtarza prywatne ścieżki dla botów dozwolonych z nazwy, a zablokowanym botom przypisuje pojedynczą regułę Disallow: /.

Niektóre tokeny nie służą do pobierania stron

Google-Extended i Applebot-Extended nie mają własnego user-agenta. Strony pobierają Googlebot i Applebot, a rozszerzone tokeny informują Google i Apple, czy mogą wykorzystywać te treści do trenowania swoich modeli. Google stosuje też Google-Extended do ugruntowywania odpowiedzi Gemini.

Większość operatorów rozdziela trenowanie i wyszukiwanie

OpenAI, Anthropic, Amazon i Mistral używają osobnych tokenów do trenowania i wyszukiwania, więc ustawienie „Bez trenowania” nie wyklucza Twojej witryny z ich usług wyszukiwania. Wyjątkiem jest Meta: meta-externalagent obejmuje zarówno trenowanie, jak i indeksowanie.

Applebot korzysta z zasad Googlebota, jeśli nie ma własnych

Apple informuje, że jeśli plik nie zawiera grupy Applebot, Applebot stosuje zasady Googlebota. Applebot ignoruje też Crawl-delay, podobnie jak Amazonbot, natomiast Anthropic deklaruje, że ClaudeBot go respektuje.

Pytania o robots.txt i boty AI

Jak zablokować GPTBot, nie tracąc miejsca w wyszukiwarce ChatGPT?

Dodaj Disallow dla GPTBot i pozostaw OAI-SearchBot dozwolony. GPTBot zbiera dane do trenowania, OAI-SearchBot indeksuje strony na potrzeby wyszukiwarki ChatGPT, a ChatGPT-User pobiera strony na prośbę użytkownika. OpenAI opisuje wszystkie trzy boty na jednej stronie i podaje osobną listę adresów IP dla każdego z nich.

Czy zablokowanie Google-Extended usunie moją witrynę z Google Search?

Google-Extended to token sterujący bez własnego user-agenta; strony pobiera Googlebot. Dodanie Disallow dla tego tokena informuje Google, by nie używało Twoich treści do trenowania modeli Gemini ani ugruntowywania odpowiedzi. Zasady Googlebota określają natomiast, które strony są pobierane na potrzeby Search.

Czy boty AI respektują Crawl-delay?

Niektóre tak. Anthropic informuje, że ClaudeBot respektuje tę dyrektywę, natomiast Apple i Amazon twierdzą, że Applebot i Amazonbot jej nie stosują. Niezawodniejszym rozwiązaniem jest ograniczanie liczby żądań na serwerze.

Dlaczego ChatGPT-User nadal odwiedza moją witrynę po zablokowaniu?

OpenAI informuje, że zasady robots.txt mogą nie dotyczyć ChatGPT-User, ponieważ stronę wskazał użytkownik. Podobne zastrzeżenia dotyczą Perplexity-User, Amzn-User i meta-externalfetcher. Jeśli operator publikuje listę adresów IP, porównuj z nią żądania i blokuj je na firewallu.

Do czego służy Content-Signal w robots.txt?

Określa, jak można używać pobranej treści, za pomocą trzech sygnałów: search, ai-input i ai-train. Każdy z nich przyjmuje wartość yes albo no. Wyraża preferencje, ale niczego nie blokuje. Cloudflare's Markdown for Agents domyślnie ustawia ai-train=yes, search=yes i ai-input=yes, więc jeśli korzystasz z tej funkcji, sprawdź jej wynik.

Źródła

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers

Niezależne źródło informacji dla osób tworzących agentów AI. Nie jesteśmy powiązani z żadnym wymienionym tu dostawcą.

© 2026 DotsAgent · Dane sprawdzone 1 października 2026