Gawing nababasa ng mga AI agent ang site mo
Iba ang paraan ng pagbasa ng mga AI crawler at agent sa site mo kumpara sa mga tao. Ginagawa ng mga tool sa ibaba ang mga file na hinahanap nila. Ipinapaliwanag naman ng sanggunian sa ibaba ng mga ito kung alin ang mga pamantayan, alin ang mga draft, at kung ilang client talaga ang gumagamit sa mga ito.
llms.txt generator
Maglagay ng pangalan, buod at mga seksyon ng link, at kopyahin ang file sa format na llmstxt.org.
robots.txt para sa mga AI bot
Magtakda ng patakaran ayon sa layunin ng bot, i-on o i-off ang mga indibidwal na crawler, magdagdag ng Content-Signal at i-download ang resulta.
API catalog
Ilista ang mga API mo kasama ang kanilang mga OpenAPI file at dokumentasyon, at kumuha ng RFC 9727 linkset at nginx block para maihatid ito.
Directory ng mga AI bot
40 crawler at agent, kasama ang kani-kanilang token, layunin, gawi sa robots.txt at inilathalang mga IP list.
Mga convention at kung gaano na katatag ang mga ito
Status noong October 2026. May link ang bawat entry papunta sa spec o sa ebidensiyang pinagbabatayan nito, para matimbang mo kung sulit itong gawin para sa site mo.
robots.txt Pamantayan
Tinutukoy ng file sa root ng site mo ang mga crawler ayon sa token at inililista ang mga path na dapat iwasan ng bawat isa; isinapamantayan ito bilang RFC 9309. Naglalathala na ngayon ang mga AI operator ng magkakahiwalay na token para sa training, search at mga fetch na pinasimulan ng user, kaya puwedeng tanggihan ng iisang file ang training habang pinapahintulutan pa rin ang search. Boluntaryo ang pagsunod, at sinasabi ng ilang fetcher na pinasimulan ng user na maaaring hindi naaangkop sa kanila ang mga patakarang ito.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal Malawakang ginagamit
Isang dagdag na linya sa robots.txt na nagsasaad kung paano maaaring gamitin ang nakuhang content: search, ai-input at ai-train, na bawat isa ay itinatakda sa yes o no. Inilabas ito ng Cloudflare bilang patakarang CC0 noong Setyembre 2025 at ginagamit ito sa humigit-kumulang 3.8 million na domain sa pamamagitan ng pinamamahalaan nitong robots.txt. Nag-expire ang katugmang IETF draft noong 4 April 2026, habang nagpapatuloy ang IETF AIPREF working group sa paggawa ng vocabulary draft.
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt Panukala
Isang Markdown file sa /llms.txt na may pangalang nasa H1, buod na nasa blockquote at mga seksyon ng link na nasa H2, para maabot ng agent ang mahahalagang page mo nang hindi kailangang i-parse ang navigation. Binago ang spec sa llmstxt.org noong 10 August 2026, at hindi ito bahagi ng spec ang llms-full.txt. Wala kaming pahayag mula sa operator na nagbabasa ng file na ito ang alinman sa mga pangunahing crawler.
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestMga Markdown na bersyon ng mga page Bahagyang paggamit
Mag-publish ng Markdown na kopya ng bawat page sa page.md o page.html.md, o maghatid ng Markdown para sa anumang request na humihingi ng text/markdown sa Accept header nito. Sa pagsubok ng Checkly noong February 2026, ipinadala ng Claude Code, Cursor at OpenCode ang header na iyon, pero hindi ito ipinadala ng Codex, Gemini CLI, GitHub Copilot at Windsurf. Nagtala ang AnswerShare ng 1,277,965 request mula sa mga frontier crawler, at wala ni isa sa mga ito ang humingi ng Markdown.
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownKatalogo ng API Pamantayan
Itinalaga ng RFC 9727, na inilathala noong June 2025, ang /.well-known/api-catalog bilang lokasyon ng listahan ng iyong mga pampublikong API; bawat isa ay may link sa machine-readable na paglalarawan, dokumentasyon at status page nito. Dapat application/linkset+json ang response, at maaaring tumuro rito ang ibang page gamit ang api-catalog link relation.
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}Mga nilagdaang request ng agent (Web Bot Auth) Draft
Nilalagdaan ng mga agent ang bawat request gamit ang HTTP Message Signatures (RFC 9421) at ipinapangalan ang operator nila sa Signature-Agent header. Tinitingnan mo ang lagda gamit ang mga key na inilalathala ng operator sa ilalim ng /.well-known/http-message-signatures-directory. May petsang 1 September 2026 ang draft ng IETF working group; lumalagda na ang ChatGPT agent gamit ang https://chatgpt.com, at nagsasagawa ng mga pagsubok ang Google gamit ang https://agent.bot.goog.
Signature-Agent: "https://chatgpt.com"NLWeb Natigil
Nagbibigay ang NLWeb ng Microsoft sa mga site ng mga endpoint na /ask at /mcp na maaaring tanungin ng mga agent gamit ang natural na wika, at nasa bersyong 0.55 ang spec nito. Iniulat ng Lumar na nag-expire ang certificate ng nlweb.ai noong 4 August 2026 at walang gaanong aktibidad sa repository mula pa noong June, kaya maghintay muna bago ito gawing pundasyon ng iyong proyekto.
Mga agent na hindi nagpapakilala
May ilang agent na walang inilalathalang robots.txt token at nagba-browse na parang user, kaya hindi sila maaabot ng anumang User-agent rule. Nilalagdaan ng ChatGPT agent ang mga request nito gamit ang Web Bot Auth at ipinapadala ang Signature-Agent: "https://chatgpt.com", na maaari mong beripikahin gamit ang key directory ng OpenAI; tinutukoy ng Cloudflare ang traffic na ito bilang chatgpt-agent. Walang dokumentadong signal ang Gemini Spark sa local Chrome mode at ang Muse ng Meta.
Mga tanong tungkol sa mga site na handa para sa agent
Ano ang kailangan para maging handa para sa agent ang isang website?
Walang iisang standard na nagtatakda nito. Sa praktika, nangangahulugan ito ng robots.txt na tumutukoy sa mga AI bot ayon sa layunin, mga opsyonal na file gaya ng llms.txt at isang API catalog, mga Markdown na bersyon ng mahahalagang page, at paraan para beripikahin ang mga pinapapasok mong agent. Sa mga ito, robots.txt at ang API catalog lang ang mga RFC na nailathala.
Binabasa ba ng mga AI crawler ang llms.txt?
Wala kaming dokumentasyon mula sa mga operator na nagsasabing kinukuha ito ng alinman sa mga crawler sa aming directory. Sinusuri ng Lighthouse kung umiiral ang file, at mababasa ito ng agent na itinuro mo rito gaya ng ibang page. Ituring ito bilang kaginhawahan para sa mga agent, hindi bilang feature para sa paghahanap.
Dapat ko bang harangan ang mga AI crawler sa site ko?
Magpasya ayon sa layunin, hindi nang sabay-sabay para sa lahat. Maaari mong tanggihan ang mga training token gaya ng GPTBot, ClaudeBot at Google-Extended nang hindi naaapektuhan ang paghahanap. Kapag hinarangan mo ang mga search token gaya ng OAI-SearchBot o PerplexityBot, hindi na maisasama ang site mo sa mga produktong iyon.
Maaari ko bang harangan ang ChatGPT agent gamit ang robots.txt?
Hindi, dahil wala itong inilalathalang token. Makikilala mo ito sa Web Bot Auth signature nito mula sa https://chatgpt.com at maaari mo itong payagan o tanggihan sa server o CDN mo. Pinatutunayan ng valid na signature kung aling operator ang nagpadala ng request, hindi kung sino ang user o kung ano ang maaari niyang gawin.
Opisyal bang standard ang Content-Signal?
Hindi. Isa itong patakaran ng Cloudflare na saklaw ng CC0, inilunsad noong September 2025 at inilalathala sa humigit-kumulang 3.8 million na domain sa pamamagitan ng pinamamahalaang robots.txt ng Cloudflare. Nag-expire ang IETF draft nito noong 4 April 2026, at binubuo pa rin ng AIPREF working group ang isang pinagsasaluhang bokabularyo.