Buat situs Anda mudah dibaca oleh agent AI
Crawler dan agent AI membaca situs Anda dengan cara berbeda dari manusia. Alat di bawah ini membuat file yang mereka cari. Referensi setelahnya menjelaskan konvensi mana yang merupakan standar, mana yang masih berupa draf, dan berapa banyak klien yang benar-benar menggunakannya.
Generator llms.txt
Masukkan nama, ringkasan, dan bagian berisi tautan, lalu salin file dalam format llmstxt.org.
robots.txt untuk bot AI
Atur kebijakan untuk tiap tujuan bot, aktifkan atau nonaktifkan crawler satu per satu, tambahkan Content-Signal, lalu unduh hasilnya.
Katalog API
Cantumkan API Anda beserta file OpenAPI dan dokumentasinya, lalu dapatkan linkset RFC 9727 dan blok nginx untuk menyajikannya.
Direktori bot AI
40 crawler dan agent beserta token, tujuan, perilaku terhadap robots.txt, dan daftar IP yang dipublikasikan.
Konvensi dan status penerapannya
Status per Oktober 2026. Tiap entri tertaut ke spesifikasi atau bukti yang mendukungnya, agar Anda bisa menilai mana yang layak diterapkan di situs Anda.
robots.txt Standar
File di root situs Anda mencantumkan crawler berdasarkan token dan jalur yang harus dilewati masing-masing; format ini distandardisasi dalam RFC 9309. Operator AI kini menerbitkan token terpisah untuk pelatihan, pencarian, dan pengambilan yang dipicu pengguna, sehingga satu file dapat menolak pelatihan sekaligus mengizinkan pencarian. Kepatuhan bersifat sukarela, dan beberapa pengambil data yang dipicu pengguna menyatakan bahwa aturan tersebut mungkin tidak berlaku bagi mereka.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal Banyak digunakan
Satu baris tambahan di robots.txt yang menyatakan cara konten yang diambil boleh digunakan: search, ai-input, dan ai-train, masing-masing diatur ke yes atau no. Cloudflare merilisnya sebagai kebijakan CC0 pada September 2025 dan menyajikannya di sekitar 3.8 juta domain melalui robots.txt terkelolanya. Draf IETF yang terkait kedaluwarsa pada 4 April 2026, sementara kelompok kerja AIPREF di IETF melanjutkan penyusunan draf kosakata.
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt Usulan
File Markdown di /llms.txt yang berisi nama H1, ringkasan blockquote, dan bagian H2 berisi tautan, agar agent dapat mengakses halaman utama tanpa mengurai navigasi. Spesifikasi di llmstxt.org direvisi pada 10 August 2026, dan llms-full.txt bukan bagian darinya. Kami belum menemukan pernyataan operator bahwa crawler besar mana pun membaca file ini.
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestVersi Markdown dari halaman Adopsi parsial
Publikasikan salinan Markdown dari setiap halaman di page.md atau page.html.md, atau sajikan Markdown untuk setiap permintaan dengan header Accept yang meminta text/markdown. Dalam pengujian Checkly pada Februari 2026, Claude Code, Cursor, dan OpenCode mengirim header tersebut, sedangkan Codex, Gemini CLI, GitHub Copilot, dan Windsurf tidak. AnswerShare menghitung 1,277,965 permintaan dari crawler frontier dan tak satu pun meminta Markdown.
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownKatalog API Standar
RFC 9727, yang diterbitkan pada Juni 2025, menetapkan /.well-known/api-catalog sebagai lokasi daftar API publik Anda. Setiap API ditautkan ke deskripsi yang dapat dibaca mesin, dokumentasi, dan halaman statusnya. Respons harus menggunakan application/linkset+json, dan halaman lain dapat merujuk ke katalog ini dengan relasi tautan api-catalog.
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}Permintaan agent bertanda tangan (Web Bot Auth) Draf
Agent menandatangani setiap permintaan dengan HTTP Message Signatures (RFC 9421) dan mencantumkan operatornya di header Signature-Agent. Anda memeriksa tanda tangan tersebut menggunakan kunci yang dipublikasikan operator di /.well-known/http-message-signatures-directory. Draf kelompok kerja IETF ini bertanggal 1 September 2026; agent ChatGPT sudah menandatangani permintaan sebagai https://chatgpt.com, dan Google sedang bereksperimen dengan https://agent.bot.goog.
Signature-Agent: "https://chatgpt.com"NLWeb Terhenti
NLWeb dari Microsoft menyediakan endpoint /ask dan /mcp yang dapat dikueri agen menggunakan bahasa alami. Spesifikasinya berada di versi 0.55. Lumar melaporkan bahwa sertifikat nlweb.ai kedaluwarsa pada 4 August 2026 dan repository-nya tidak aktif sejak Juni, jadi tunggu sebelum menjadikannya fondasi.
Agen yang tidak mengumumkan identitasnya
Beberapa agen tidak memublikasikan token di robots.txt dan menjelajah seperti pengguna, sehingga aturan User-agent tidak dapat menjangkau mereka. Agen ChatGPT menandatangani permintaannya dengan Web Bot Auth dan mengirim Signature-Agent: "https://chatgpt.com". Anda dapat memverifikasinya menggunakan direktori kunci OpenAI; Cloudflare mengidentifikasi trafik tersebut sebagai chatgpt-agent. Gemini Spark dalam mode Chrome lokal dan Muse dari Meta sama sekali tidak memiliki sinyal yang terdokumentasi.
Pertanyaan tentang situs yang siap digunakan agen
Apa yang membuat situs web siap digunakan agen?
Tidak ada satu standar yang mendefinisikannya. Dalam praktiknya, ini berarti robots.txt yang mencantumkan bot AI berdasarkan tujuan, file opsional seperti llms.txt dan katalog API, versi Markdown untuk halaman penting, serta cara memverifikasi agen yang Anda izinkan mengakses situs. Dari semua itu, hanya robots.txt dan katalog API yang diterbitkan sebagai RFC.
Apakah crawler AI membaca llms.txt?
Kami tidak menemukan dokumentasi operator yang menyatakan bahwa crawler mana pun di direktori kami mengambil file ini. Lighthouse memeriksa apakah file tersebut tersedia, dan agen yang Anda arahkan ke sana dapat membacanya seperti halaman lainnya. Anggap file ini sebagai kemudahan bagi agen, bukan fitur pencarian.
Haruskah saya memblokir crawler AI di situs saya?
Tentukan berdasarkan tujuan, bukan sekaligus untuk semuanya. Anda dapat menolak token pelatihan seperti GPTBot, ClaudeBot, dan Google-Extended tanpa memengaruhi pencarian. Memblokir token pencarian seperti OAI-SearchBot atau PerplexityBot akan membuat situs Anda tidak tersedia di produk-produk tersebut.
Bisakah saya memblokir agen ChatGPT dengan robots.txt?
Tidak, karena agen ini tidak memublikasikan token. Anda dapat mengenalinya dari tanda tangan Web Bot Auth-nya yang berasal dari https://chatgpt.com, lalu mengizinkan atau menolaknya di server atau CDN Anda. Tanda tangan yang valid membuktikan operator mana yang mengirim permintaan, bukan siapa penggunanya atau apa yang boleh dilakukannya.
Apakah Content-Signal standar resmi?
Tidak. Content-Signal adalah kebijakan CC0 dari Cloudflare yang diluncurkan pada September 2025 dan diterapkan di sekitar 3.8 juta domain melalui robots.txt terkelola Cloudflare. Draf IETF-nya kedaluwarsa pada 4 April 2026, sementara kelompok kerja AIPREF masih menyusun kosakata bersama.