Генератор robots.txt для AI-ботов
Выберите правила для каждого типа AI-ботов, задайте исключения для отдельных краулеров и скопируйте файл, соответствующий RFC 9309. Для обучения, поиска и загрузки по запросу пользователя используются разные токены, поэтому одним можно запретить доступ, а другим — разрешить.
# AI-краулеры, которым запрещён доступ ко всему сайту
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /
# Разрешённые AI-краулеры; приватные пути исключены
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/
# Все остальные краулеры
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml
Правила robots.txt добровольны. ChatGPT-User, Perplexity-User и другие загрузчики, запускаемые по запросу пользователя, заявляют, что эти правила могут на них не распространяться; у некоторых агентов вообще нет токена. Чтобы гарантированно блокировать запросы, сверяйте их с опубликованными списками IP-адресов или сигнатурами и отклоняйте на межсетевом экране или WAF.
Как работает сгенерированный файл
Краулер следует правилам своей группы
Если краулер находит свой токен в строке User-agent, он следует правилам этой группы и пропускает правила под User-agent: *. Поэтому генератор повторяет приватные пути для ботов, которым вы разрешили доступ по имени, а для заблокированных ботов задаёт единственное правило Disallow: /.
Некоторые токены не используются для обхода
У Google-Extended и Applebot-Extended нет собственного user agent. Страницы загружают Googlebot и Applebot, а расширенные токены указывают Google и Apple, можно ли использовать этот контент для обучения их моделей; Google также применяет Google-Extended для поиска с опорой на Gemini.
Большинство операторов разделяют обучение и поиск
OpenAI, Anthropic, Amazon и Mistral используют отдельные токены для обучения и поиска, поэтому пресет «Без обучения» сохраняет доступность вашего сайта в их поисковых продуктах. Исключение — Meta: meta-externalagent отвечает и за обучение, и за индексацию.
Applebot использует правила Googlebot, если своих нет
Если в файле нет группы Applebot, Apple сообщает, что Applebot вместо этого следует правилам Googlebot. Applebot, как и Amazonbot, игнорирует Crawl-delay, тогда как Anthropic сообщает, что ClaudeBot его соблюдает.
Вопросы о robots.txt и AI-ботах
Как заблокировать GPTBot, не отключая поиск ChatGPT?
Запретите GPTBot и оставьте OAI-SearchBot разрешённым. GPTBot собирает данные для обучения, OAI-SearchBot индексирует страницы для поиска ChatGPT, а ChatGPT-User загружает страницы по запросу человека. OpenAI описывает все три токена на одной странице и приводит для каждого отдельный список IP-адресов.
Исключит ли блокировка Google-Extended мой сайт из Google Search?
Google-Extended — это управляющий токен без собственного user agent; обход выполняет Googlebot. Запретив его, вы сообщаете Google, что ваш контент нельзя использовать для обучения Gemini и поиска с опорой на Gemini. Правила для Googlebot определяют, какие страницы обходятся для Search.
Соблюдают ли AI-краулеры Crawl-delay?
Некоторые — да. Anthropic сообщает, что ClaudeBot соблюдает это правило, а Apple и Amazon указывают, что Applebot и Amazonbot его игнорируют. Надёжнее всего ограничивать частоту запросов на сервере.
Почему ChatGPT-User всё ещё посещает сайт после блокировки?
OpenAI сообщает, что правила robots.txt могут не распространяться на ChatGPT-User, поскольку страницу запросил человек. Для Perplexity-User, Amzn-User и meta-externalfetcher действуют аналогичные оговорки. Если оператор публикует список IP-адресов, сверяйте с ним запросы и блокируйте их на межсетевом экране.
Для чего нужен Content-Signal в robots.txt?
Он указывает, как можно использовать контент после его получения, с помощью трёх сигналов: search, ai-input и ai-train, каждому из которых задаётся значение yes или no. Это выражение предпочтений, а не запрет. Cloudflare Markdown for Agents по умолчанию добавляет ai-train=yes, search=yes и ai-input=yes, поэтому при использовании этой функции проверьте её результат.