Сделайте сайт понятным для ИИ-агентов
ИИ-краулеры и агенты читают сайты не так, как люди. Инструменты ниже создают файлы, которые они ищут, а в справочнике описано, какие соглашения стали стандартами, какие пока остаются черновиками и сколько клиентов ими действительно пользуются.
Генератор llms.txt
Укажите название, краткое описание и разделы со ссылками, чтобы создать файл в формате llmstxt.org.
robots.txt для ИИ-ботов
Задайте правила для каждой цели бота, включайте и отключайте отдельных краулеров, добавьте Content-Signal и скачайте готовый файл.
Каталог API
Добавьте API со спецификациями OpenAPI и документацией, чтобы получить linkset по RFC 9727 и блок конфигурации nginx для его публикации.
Справочник ИИ-ботов
40 краулеров и агентов: их токены, назначение, поведение при обработке robots.txt и опубликованные списки IP-адресов.
Соглашения и степень их распространённости
Статус на октябрь 2026 года. Для каждой записи есть ссылка на спецификацию или подтверждающие данные — так вы сможете решить, что стоит внедрить на своём сайте.
robots.txt Стандарт
Файл в корневом каталоге сайта указывает краулеры по токенам и перечисляет пути, которые каждому из них следует пропускать; его формат стандартизирован в RFC 9309. Теперь операторы ИИ публикуют отдельные токены для обучения, поиска и загрузки страниц по запросу пользователя. Поэтому один файл может запрещать сбор данных для обучения и при этом разрешать поиск. Соблюдение правил добровольное, а некоторые загрузчики страниц по запросу пользователя заявляют, что эти правила на них могут не распространяться.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal Широко используется
Дополнительная строка в robots.txt, которая указывает, как можно использовать полученный контент: search, ai-input и ai-train — для каждого параметра задаётся yes или no. Cloudflare выпустила её как политику CC0 в сентябре 2025 года и добавляет её примерно в 3.8 миллиона доменов через управляемый robots.txt. Соответствующий проект IETF истёк 4 апреля 2026 года, а рабочая группа IETF AIPREF продолжает работу над проектом словаря.
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt Предложение
Файл Markdown по пути /llms.txt с названием в заголовке H1, кратким описанием в цитате и разделами H2 со ссылками. Благодаря этому агент может перейти к ключевым страницам сайта, не разбирая навигацию. Спецификацию на llmstxt.org пересмотрели 10 августа 2026 года; llms-full.txt в неё не входит. У нас нет заявлений операторов о том, что этот файл читает какой-либо крупный crawler.
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestВерсии страниц в Markdown Частичное внедрение
Публикуйте копию каждой страницы в формате Markdown по адресу page.md или page.html.md либо отдавайте Markdown в ответ на запросы, в заголовке Accept которых указан text/markdown. В тесте Checkly за февраль 2026 года этот заголовок отправляли Claude Code, Cursor и OpenCode, а Codex, Gemini CLI, GitHub Copilot и Windsurf — нет. AnswerShare зарегистрировал 1,277,965 запросов от ведущих crawler, и ни в одном из них не запрашивался Markdown.
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownКаталог API Стандарт
Опубликованный в июне 2025 года RFC 9727 закрепляет путь /.well-known/api-catalog для списка публичных API. Для каждого API указываются ссылки на машиночитаемое описание, документацию и страницу статуса. Ответ должен иметь тип application/linkset+json; другие страницы могут ссылаться на него с помощью отношения ссылки api-catalog.
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}Подписанные запросы агентов (Web Bot Auth) Черновик
Агенты подписывают каждый запрос с помощью HTTP Message Signatures (RFC 9421) и указывают своего оператора в заголовке Signature-Agent. Проверьте подпись по ключам, которые оператор публикует по адресу /.well-known/http-message-signatures-directory. Проект рабочей группы IETF датирован 1 сентября 2026 года; агент ChatGPT уже подписывает запросы как https://chatgpt.com, а Google экспериментирует с https://agent.bot.goog.
Signature-Agent: "https://chatgpt.com"NLWeb Приостановлено
NLWeb от Microsoft предоставляет сайту эндпоинты /ask и /mcp, к которым агенты могут обращаться на естественном языке. Спецификация достигла версии 0.55. По данным Lumar, сертификат nlweb.ai истёк 4 August 2026, а репозиторий не обновлялся с июня. Поэтому пока не стоит строить на этом решении.
Агенты, которые не представляются
Некоторые агенты не публикуют токен в robots.txt и просматривают сайты так же, как пользователи, поэтому правило User-agent на них не подействует. ChatGPT agent подписывает запросы с помощью Web Bot Auth и передаёт Signature-Agent: "https://chatgpt.com". Подпись можно проверить по каталогу ключей OpenAI; Cloudflare помечает такой трафик как chatgpt-agent. Для Gemini Spark в локальном режиме Chrome и Muse от Meta никакие сигналы не документированы.
Вопросы о сайтах, готовых к работе с агентами
Что делает сайт готовым к работе с агентами?
Единого стандарта нет. На практике это означает, что в robots.txt перечислены ИИ-боты с указанием их назначения, при необходимости доступны такие файлы, как llms.txt, и каталог API, ключевые страницы представлены в Markdown, а агентов, которым разрешён доступ, можно проверить. Из перечисленного только robots.txt и каталог API опубликованы как RFC.
Читают ли ИИ-краулеры файл llms.txt?
В документации операторов нет сведений о том, что какой-либо краулер из нашего каталога запрашивает этот файл. Lighthouse проверяет, существует ли он, а агент, которому вы укажете его адрес, может прочитать его как любую другую страницу. Рассматривайте llms.txt как удобство для агентов, а не как функцию поиска.
Нужно ли блокировать ИИ-краулеры на сайте?
Принимайте решение отдельно для каждого назначения, а не блокируйте всё сразу. Токены для обучения, такие как GPTBot, ClaudeBot и Google-Extended, можно заблокировать, не затрагивая поиск. Блокировка поисковых токенов, например OAI-SearchBot или PerplexityBot, полностью исключит сайт из соответствующих продуктов.
Можно ли заблокировать ChatGPT agent с помощью robots.txt?
Нет: он не публикует токен. Его можно распознать по подписи Web Bot Auth с https://chatgpt.com и разрешить или запретить ему доступ на сервере или CDN. Действительная подпись подтверждает, какой оператор отправил запрос, но не устанавливает личность пользователя и его права.
Является ли Content-Signal официальным стандартом?
Нет. Это политика Cloudflare с лицензией CC0, представленная в сентябре 2025 года и применяемая примерно на 3.8 миллиона доменов через управляемый Cloudflare файл robots.txt. Срок действия черновика IETF истёк 4 April 2026, а рабочая группа AIPREF всё ещё разрабатывает общую терминологию.