AIエージェントが読み取れるサイトにする
AIクローラーやエージェントは、人間とは異なる方法でサイトを読み取ります。以下のツールで、エージェントが参照するファイルを生成できます。その下のリファレンスでは、どの規約が標準で、どれがドラフトなのか、実際にどれだけのクライアントが利用しているのかを確認できます。
llms.txtジェネレーター
サイト名、概要、リンクのセクションを入力すると、llmstxt.org形式のファイルをコピーできます。
AIボット向けrobots.txt
ボットの目的ごとにポリシーを設定し、クローラーを個別に切り替え、Content-Signalを追加して、結果をダウンロードできます。
APIカタログ
OpenAPIファイルとドキュメントを添えてAPIを一覧にすると、RFC 9727のlinksetと、配信用のnginxブロックを生成できます。
AIボットディレクトリ
40種類のクローラーとエージェントについて、トークン、目的、robots.txtへの対応状況、公開IPリストを確認できます。
各規約の概要と成熟度
2026年10月時点の状況です。各項目から仕様または根拠資料にアクセスできるため、サイトで対応する価値があるか判断できます。
robots.txt 標準
サイトのルートに置くこのファイルでは、トークンでクローラーを指定し、それぞれが避けるパスを列挙します。RFC 9309として標準化されています。AI事業者は現在、学習、検索、ユーザー操作による取得に別々のトークンを公開しています。そのため、1つのファイルで学習を拒否しながら、検索は許可できます。遵守は任意であり、ユーザー操作による取得を行うクローラーの中には、ルールが適用されない場合があると明記しているものもあります。
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal 広く利用
取得したコンテンツの使用方法を示すrobots.txtの追加行です。search、ai-input、ai-trainをそれぞれyesまたはnoで指定します。Cloudflareは2025年9月にCC0ポリシーとして公開し、管理対象のrobots.txtを通じて約3.8 millionのドメインで提供しています。対応するIETFドラフトは2026年4月4日に失効しましたが、IETFのAIPREFワーキンググループでは語彙のドラフト策定が続いています。
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt 提案
エージェントがナビゲーションを解析せずに主要なページへアクセスできるよう、/llms.txtにH1のサイト名、blockquote形式の概要、リンクをまとめたH2セクションを記述します。llmstxt.orgの仕様は2026年8月10日に改訂されました。llms-full.txtは仕様に含まれていません。主要なcrawlerがこのファイルを読み取るという運営者の表明は確認できていません。
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestページのMarkdown版 一部で採用
各ページのMarkdown版をpage.mdまたはpage.html.mdとして公開するか、Acceptヘッダーでtext/markdownを指定したリクエストにMarkdownを返します。Checklyが2026年2月に実施したテストでは、Claude Code、Cursor、OpenCodeはこのヘッダーを送信しましたが、Codex、Gemini CLI、GitHub Copilot、Windsurfは送信しませんでした。AnswerShareが集計したfrontier crawlerからのリクエストは1,277,965件で、Markdownを要求したものはありませんでした。
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownAPIカタログ 標準
2025年6月に公開されたRFC 9727では、公開APIの一覧を/.well-known/api-catalogに配置します。一覧の各APIには、機械可読な説明、ドキュメント、ステータスページへのリンクを記載します。レスポンスのContent-Typeはapplication/linkset+jsonでなければなりません。また、他のページからapi-catalogリンク関係を使ってこのカタログを参照できます。
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}署名付きエージェントリクエスト(Web Bot Auth) ドラフト
エージェントは各リクエストにHTTP Message Signatures(RFC 9421)で署名し、Signature-Agentヘッダーで運営者を示します。運営者が/.well-known/http-message-signatures-directoryで公開している鍵を使って署名を検証します。IETFワーキンググループのドラフトは2026年9月1日付です。ChatGPT agentはすでにhttps://chatgpt.comとして署名しており、Googleはhttps://agent.bot.googで実験を進めています。
Signature-Agent: "https://chatgpt.com"NLWeb 停滞中
MicrosoftのNLWebは、エージェントが自然言語で問い合わせられる /ask と /mcp エンドポイントをサイトに提供します。仕様のバージョンは0.55です。Lumarによると、nlweb.aiの証明書は2026年8月4日に期限切れとなり、リポジトリの更新も6月以降止まっています。利用を前提に構築するのは、しばらく待ちましょう。
名乗らずにアクセスするエージェント
一部のエージェントはrobots.txtのトークンを公開せず、ユーザーと同じようにサイトを閲覧するため、User-agentルールでは制御できません。ChatGPT agentはWeb Bot Authでリクエストに署名し、Signature-Agent: "https://chatgpt.com"を送信します。この署名はOpenAIのキーディレクトリで検証できます。Cloudflareでは、このトラフィックをchatgpt-agentとして分類しています。ローカルのChromeモードで動作するGemini SparkとMetaのMuseには、文書化された識別情報がありません。
エージェント対応サイトに関する質問
エージェント対応サイトとは何ですか?
単一の標準で定義されているわけではありません。実際には、用途別にAI botを指定したrobots.txt、llms.txtやAPIカタログなどの任意のファイル、主要ページのMarkdown版、許可したエージェントを検証する手段を備えたサイトを指します。このうちRFCとして公開されているのは、robots.txtとAPIカタログだけです。
AIクローラーはllms.txtを読みますか?
このディレクトリに掲載されているクローラーがllms.txtを取得するという運営者の文書は確認できていません。Lighthouseはファイルの有無をチェックします。また、llms.txtを指定したエージェントは、ほかのページと同じように読み取れます。検索機能ではなく、エージェント向けの便宜的なファイルとして扱ってください。
サイトでAIクローラーをブロックすべきですか?
一律ではなく、用途ごとに判断してください。GPTBot、ClaudeBot、Google-Extendedなどの学習用トークンは、検索に影響を与えずに拒否できます。OAI-SearchBotやPerplexityBotなどの検索用トークンをブロックすると、そのサービスからサイトが完全に除外されます。
robots.txtでChatGPT agentをブロックできますか?
できません。ChatGPT agentはトークンを公開していないためです。https://chatgpt.comからのWeb Bot Auth署名で識別し、サーバーまたはCDNで許可または拒否できます。有効な署名で確認できるのはリクエストの送信元の運営者であり、ユーザーの身元や実行可能な操作ではありません。
Content-Signalは公式標準ですか?
いいえ。これはCloudflareが策定したCC0ライセンスのポリシーで、2025年9月に公開されました。Cloudflareの管理するrobots.txtを通じて約3.8 millionのドメインで提供されています。IETFドラフトは2026年4月4日に期限切れとなり、AIPREFワーキンググループでは共通語彙の策定が続いています。