dotsagent.io
Язык:Русский
Откройте сайт · генератор

Генератор robots.txt для AI-ботов

Выберите правила для каждого типа AI-ботов, задайте исключения для отдельных краулеров и скопируйте файл, соответствующий RFC 9309. Для обучения, поиска и загрузки по запросу пользователя используются разные токены, поэтому одним можно запретить доступ, а другим — разрешить.

Начать с
Обучение

Запретив доступ этим ботам, вы исключите свои страницы из обучения моделей этими операторами, не затрагивая поисковую выдачу.

Поиск

Блокировка этих ботов также блокирует Googlebot и Applebot, исключая ваш сайт из Google Search и результатов Siri, Spotlight и Safari от Apple.

Запросы пользователей

Эти боты загружают страницу по запросу человека. Некоторые операторы заявляют, что правила robots.txt могут на них не распространяться, поэтому блокировка здесь — это пожелание, а не гарантия.

Агенты

Google-Agent обычно игнорирует robots.txt, а у большинства агентов для просмотра веб-страниц вообще нет токена, поэтому эта группа мало что меняет на практике.

Нажмите на бота, чтобы переключить его правило относительно настройки группы.

Content-Signal
search
ai-input
ai-train

Content-Signal указывает, как можно использовать загруженные страницы: search — для результатов поиска, ai-input — для формирования ответов AI, а ai-train — для обучения моделей. Эта директива основана на политике Cloudflare, опубликованной под лицензией CC0, и выражает предпочтение, но ничего не блокирует.

/robots.txt
# AI-краулеры, которым запрещён доступ ко всему сайту
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Разрешённые AI-краулеры; приватные пути исключены
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Все остальные краулеры
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

Правила robots.txt добровольны. ChatGPT-User, Perplexity-User и другие загрузчики, запускаемые по запросу пользователя, заявляют, что эти правила могут на них не распространяться; у некоторых агентов вообще нет токена. Чтобы гарантированно блокировать запросы, сверяйте их с опубликованными списками IP-адресов или сигнатурами и отклоняйте на межсетевом экране или WAF.

Все боты в каталоге →

Как работает сгенерированный файл

Краулер следует правилам своей группы

Если краулер находит свой токен в строке User-agent, он следует правилам этой группы и пропускает правила под User-agent: *. Поэтому генератор повторяет приватные пути для ботов, которым вы разрешили доступ по имени, а для заблокированных ботов задаёт единственное правило Disallow: /.

Некоторые токены не используются для обхода

У Google-Extended и Applebot-Extended нет собственного user agent. Страницы загружают Googlebot и Applebot, а расширенные токены указывают Google и Apple, можно ли использовать этот контент для обучения их моделей; Google также применяет Google-Extended для поиска с опорой на Gemini.

Большинство операторов разделяют обучение и поиск

OpenAI, Anthropic, Amazon и Mistral используют отдельные токены для обучения и поиска, поэтому пресет «Без обучения» сохраняет доступность вашего сайта в их поисковых продуктах. Исключение — Meta: meta-externalagent отвечает и за обучение, и за индексацию.

Applebot использует правила Googlebot, если своих нет

Если в файле нет группы Applebot, Apple сообщает, что Applebot вместо этого следует правилам Googlebot. Applebot, как и Amazonbot, игнорирует Crawl-delay, тогда как Anthropic сообщает, что ClaudeBot его соблюдает.

Вопросы о robots.txt и AI-ботах

Как заблокировать GPTBot, не отключая поиск ChatGPT?

Запретите GPTBot и оставьте OAI-SearchBot разрешённым. GPTBot собирает данные для обучения, OAI-SearchBot индексирует страницы для поиска ChatGPT, а ChatGPT-User загружает страницы по запросу человека. OpenAI описывает все три токена на одной странице и приводит для каждого отдельный список IP-адресов.

Исключит ли блокировка Google-Extended мой сайт из Google Search?

Google-Extended — это управляющий токен без собственного user agent; обход выполняет Googlebot. Запретив его, вы сообщаете Google, что ваш контент нельзя использовать для обучения Gemini и поиска с опорой на Gemini. Правила для Googlebot определяют, какие страницы обходятся для Search.

Соблюдают ли AI-краулеры Crawl-delay?

Некоторые — да. Anthropic сообщает, что ClaudeBot соблюдает это правило, а Apple и Amazon указывают, что Applebot и Amazonbot его игнорируют. Надёжнее всего ограничивать частоту запросов на сервере.

Почему ChatGPT-User всё ещё посещает сайт после блокировки?

OpenAI сообщает, что правила robots.txt могут не распространяться на ChatGPT-User, поскольку страницу запросил человек. Для Perplexity-User, Amzn-User и meta-externalfetcher действуют аналогичные оговорки. Если оператор публикует список IP-адресов, сверяйте с ним запросы и блокируйте их на межсетевом экране.

Для чего нужен Content-Signal в robots.txt?

Он указывает, как можно использовать контент после его получения, с помощью трёх сигналов: search, ai-input и ai-train, каждому из которых задаётся значение yes или no. Это выражение предпочтений, а не запрет. Cloudflare Markdown for Agents по умолчанию добавляет ai-train=yes, search=yes и ai-input=yes, поэтому при использовании этой функции проверьте её результат.

Источники

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers