dotsagent.io
Язык:Русский
Откройте свой сайт · справочник

Сделайте сайт понятным для ИИ-агентов

ИИ-краулеры и агенты читают сайты не так, как люди. Инструменты ниже создают файлы, которые они ищут, а в справочнике описано, какие соглашения стали стандартами, какие пока остаются черновиками и сколько клиентов ими действительно пользуются.

Соглашения и степень их распространённости

Статус на октябрь 2026 года. Для каждой записи есть ссылка на спецификацию или подтверждающие данные — так вы сможете решить, что стоит внедрить на своём сайте.

robots.txt Стандарт

Файл в корневом каталоге сайта указывает краулеры по токенам и перечисляет пути, которые каждому из них следует пропускать; его формат стандартизирован в RFC 9309. Теперь операторы ИИ публикуют отдельные токены для обучения, поиска и загрузки страниц по запросу пользователя. Поэтому один файл может запрещать сбор данных для обучения и при этом разрешать поиск. Соблюдение правил добровольное, а некоторые загрузчики страниц по запросу пользователя заявляют, что эти правила на них могут не распространяться.

/robots.txt
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

platform.openai.comdevelopers.google.com

Content-Signal Широко используется

Дополнительная строка в robots.txt, которая указывает, как можно использовать полученный контент: search, ai-input и ai-train — для каждого параметра задаётся yes или no. Cloudflare выпустила её как политику CC0 в сентябре 2025 года и добавляет её примерно в 3.8 миллиона доменов через управляемый robots.txt. Соответствующий проект IETF истёк 4 апреля 2026 года, а рабочая группа IETF AIPREF продолжает работу над проектом словаря.

/robots.txt
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /

blog.cloudflare.comdatatracker.ietf.org

llms.txt Предложение

Файл Markdown по пути /llms.txt с названием в заголовке H1, кратким описанием в цитате и разделами H2 со ссылками. Благодаря этому агент может перейти к ключевым страницам сайта, не разбирая навигацию. Спецификацию на llmstxt.org пересмотрели 10 августа 2026 года; llms-full.txt в неё не входит. У нас нет заявлений операторов о том, что этот файл читает какой-либо крупный crawler.

/llms.txt
# Acme API

> Card payments for small online shops.

## Docs

- [Quickstart](https://example.com/docs/quickstart.md): first request

llmstxt.orgllmstxt.org

Версии страниц в Markdown Частичное внедрение

Публикуйте копию каждой страницы в формате Markdown по адресу page.md или page.html.md либо отдавайте Markdown в ответ на запросы, в заголовке Accept которых указан text/markdown. В тесте Checkly за февраль 2026 года этот заголовок отправляли Claude Code, Cursor и OpenCode, а Codex, Gemini CLI, GitHub Copilot и Windsurf — нет. AnswerShare зарегистрировал 1,277,965 запросов от ведущих crawler, и ни в одном из них не запрашивался Markdown.

Request
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdown

developers.cloudflare.comchecklyhq.comanswershare.com

Каталог API Стандарт

Опубликованный в июне 2025 года RFC 9727 закрепляет путь /.well-known/api-catalog для списка публичных API. Для каждого API указываются ссылки на машиночитаемое описание, документацию и страницу статуса. Ответ должен иметь тип application/linkset+json; другие страницы могут ссылаться на него с помощью отношения ссылки api-catalog.

/.well-known/api-catalog
{
  "linkset": [
    {
      "anchor": "https://api.example.com/v1",
      "service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
    }
  ]
}

rfc-editor.org

Подписанные запросы агентов (Web Bot Auth) Черновик

Агенты подписывают каждый запрос с помощью HTTP Message Signatures (RFC 9421) и указывают своего оператора в заголовке Signature-Agent. Проверьте подпись по ключам, которые оператор публикует по адресу /.well-known/http-message-signatures-directory. Проект рабочей группы IETF датирован 1 сентября 2026 года; агент ChatGPT уже подписывает запросы как https://chatgpt.com, а Google экспериментирует с https://agent.bot.goog.

Request header
Signature-Agent: "https://chatgpt.com"

datatracker.ietf.orgblog.cloudflare.com

NLWeb Приостановлено

NLWeb от Microsoft предоставляет сайту эндпоинты /ask и /mcp, к которым агенты могут обращаться на естественном языке. Спецификация достигла версии 0.55. По данным Lumar, сертификат nlweb.ai истёк 4 August 2026, а репозиторий не обновлялся с июня. Поэтому пока не стоит строить на этом решении.

github.comagentic-readiness.lumar.io

Агенты, которые не представляются

Некоторые агенты не публикуют токен в robots.txt и просматривают сайты так же, как пользователи, поэтому правило User-agent на них не подействует. ChatGPT agent подписывает запросы с помощью Web Bot Auth и передаёт Signature-Agent: "https://chatgpt.com". Подпись можно проверить по каталогу ключей OpenAI; Cloudflare помечает такой трафик как chatgpt-agent. Для Gemini Spark в локальном режиме Chrome и Muse от Meta никакие сигналы не документированы.

Вопросы о сайтах, готовых к работе с агентами

Что делает сайт готовым к работе с агентами?

Единого стандарта нет. На практике это означает, что в robots.txt перечислены ИИ-боты с указанием их назначения, при необходимости доступны такие файлы, как llms.txt, и каталог API, ключевые страницы представлены в Markdown, а агентов, которым разрешён доступ, можно проверить. Из перечисленного только robots.txt и каталог API опубликованы как RFC.

Читают ли ИИ-краулеры файл llms.txt?

В документации операторов нет сведений о том, что какой-либо краулер из нашего каталога запрашивает этот файл. Lighthouse проверяет, существует ли он, а агент, которому вы укажете его адрес, может прочитать его как любую другую страницу. Рассматривайте llms.txt как удобство для агентов, а не как функцию поиска.

Нужно ли блокировать ИИ-краулеры на сайте?

Принимайте решение отдельно для каждого назначения, а не блокируйте всё сразу. Токены для обучения, такие как GPTBot, ClaudeBot и Google-Extended, можно заблокировать, не затрагивая поиск. Блокировка поисковых токенов, например OAI-SearchBot или PerplexityBot, полностью исключит сайт из соответствующих продуктов.

Можно ли заблокировать ChatGPT agent с помощью robots.txt?

Нет: он не публикует токен. Его можно распознать по подписи Web Bot Auth с https://chatgpt.com и разрешить или запретить ему доступ на сервере или CDN. Действительная подпись подтверждает, какой оператор отправил запрос, но не устанавливает личность пользователя и его права.

Является ли Content-Signal официальным стандартом?

Нет. Это политика Cloudflare с лицензией CC0, представленная в сентябре 2025 года и применяемая примерно на 3.8 миллиона доменов через управляемый Cloudflare файл robots.txt. Срок действия черновика IETF истёк 4 April 2026, а рабочая группа AIPREF всё ещё разрабатывает общую терминологию.