dotsagent.io
Wika:Filipino
Buksan ang site mo · sanggunian

Gawing nababasa ng mga AI agent ang site mo

Iba ang paraan ng pagbasa ng mga AI crawler at agent sa site mo kumpara sa mga tao. Ginagawa ng mga tool sa ibaba ang mga file na hinahanap nila. Ipinapaliwanag naman ng sanggunian sa ibaba ng mga ito kung alin ang mga pamantayan, alin ang mga draft, at kung ilang client talaga ang gumagamit sa mga ito.

Mga convention at kung gaano na katatag ang mga ito

Status noong October 2026. May link ang bawat entry papunta sa spec o sa ebidensiyang pinagbabatayan nito, para matimbang mo kung sulit itong gawin para sa site mo.

robots.txt Pamantayan

Tinutukoy ng file sa root ng site mo ang mga crawler ayon sa token at inililista ang mga path na dapat iwasan ng bawat isa; isinapamantayan ito bilang RFC 9309. Naglalathala na ngayon ang mga AI operator ng magkakahiwalay na token para sa training, search at mga fetch na pinasimulan ng user, kaya puwedeng tanggihan ng iisang file ang training habang pinapahintulutan pa rin ang search. Boluntaryo ang pagsunod, at sinasabi ng ilang fetcher na pinasimulan ng user na maaaring hindi naaangkop sa kanila ang mga patakarang ito.

/robots.txt
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

platform.openai.comdevelopers.google.com

Content-Signal Malawakang ginagamit

Isang dagdag na linya sa robots.txt na nagsasaad kung paano maaaring gamitin ang nakuhang content: search, ai-input at ai-train, na bawat isa ay itinatakda sa yes o no. Inilabas ito ng Cloudflare bilang patakarang CC0 noong Setyembre 2025 at ginagamit ito sa humigit-kumulang 3.8 million na domain sa pamamagitan ng pinamamahalaan nitong robots.txt. Nag-expire ang katugmang IETF draft noong 4 April 2026, habang nagpapatuloy ang IETF AIPREF working group sa paggawa ng vocabulary draft.

/robots.txt
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /

blog.cloudflare.comdatatracker.ietf.org

llms.txt Panukala

Isang Markdown file sa /llms.txt na may pangalang nasa H1, buod na nasa blockquote at mga seksyon ng link na nasa H2, para maabot ng agent ang mahahalagang page mo nang hindi kailangang i-parse ang navigation. Binago ang spec sa llmstxt.org noong 10 August 2026, at hindi ito bahagi ng spec ang llms-full.txt. Wala kaming pahayag mula sa operator na nagbabasa ng file na ito ang alinman sa mga pangunahing crawler.

/llms.txt
# Acme API

> Card payments for small online shops.

## Docs

- [Quickstart](https://example.com/docs/quickstart.md): first request

llmstxt.orgllmstxt.org

Mga Markdown na bersyon ng mga page Bahagyang paggamit

Mag-publish ng Markdown na kopya ng bawat page sa page.md o page.html.md, o maghatid ng Markdown para sa anumang request na humihingi ng text/markdown sa Accept header nito. Sa pagsubok ng Checkly noong February 2026, ipinadala ng Claude Code, Cursor at OpenCode ang header na iyon, pero hindi ito ipinadala ng Codex, Gemini CLI, GitHub Copilot at Windsurf. Nagtala ang AnswerShare ng 1,277,965 request mula sa mga frontier crawler, at wala ni isa sa mga ito ang humingi ng Markdown.

Request
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdown

developers.cloudflare.comchecklyhq.comanswershare.com

Katalogo ng API Pamantayan

Itinalaga ng RFC 9727, na inilathala noong June 2025, ang /.well-known/api-catalog bilang lokasyon ng listahan ng iyong mga pampublikong API; bawat isa ay may link sa machine-readable na paglalarawan, dokumentasyon at status page nito. Dapat application/linkset+json ang response, at maaaring tumuro rito ang ibang page gamit ang api-catalog link relation.

/.well-known/api-catalog
{
  "linkset": [
    {
      "anchor": "https://api.example.com/v1",
      "service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
    }
  ]
}

rfc-editor.org

Mga nilagdaang request ng agent (Web Bot Auth) Draft

Nilalagdaan ng mga agent ang bawat request gamit ang HTTP Message Signatures (RFC 9421) at ipinapangalan ang operator nila sa Signature-Agent header. Tinitingnan mo ang lagda gamit ang mga key na inilalathala ng operator sa ilalim ng /.well-known/http-message-signatures-directory. May petsang 1 September 2026 ang draft ng IETF working group; lumalagda na ang ChatGPT agent gamit ang https://chatgpt.com, at nagsasagawa ng mga pagsubok ang Google gamit ang https://agent.bot.goog.

Request header
Signature-Agent: "https://chatgpt.com"

datatracker.ietf.orgblog.cloudflare.com

NLWeb Natigil

Nagbibigay ang NLWeb ng Microsoft sa mga site ng mga endpoint na /ask at /mcp na maaaring tanungin ng mga agent gamit ang natural na wika, at nasa bersyong 0.55 ang spec nito. Iniulat ng Lumar na nag-expire ang certificate ng nlweb.ai noong 4 August 2026 at walang gaanong aktibidad sa repository mula pa noong June, kaya maghintay muna bago ito gawing pundasyon ng iyong proyekto.

github.comagentic-readiness.lumar.io

Mga agent na hindi nagpapakilala

May ilang agent na walang inilalathalang robots.txt token at nagba-browse na parang user, kaya hindi sila maaabot ng anumang User-agent rule. Nilalagdaan ng ChatGPT agent ang mga request nito gamit ang Web Bot Auth at ipinapadala ang Signature-Agent: "https://chatgpt.com", na maaari mong beripikahin gamit ang key directory ng OpenAI; tinutukoy ng Cloudflare ang traffic na ito bilang chatgpt-agent. Walang dokumentadong signal ang Gemini Spark sa local Chrome mode at ang Muse ng Meta.

Mga tanong tungkol sa mga site na handa para sa agent

Ano ang kailangan para maging handa para sa agent ang isang website?

Walang iisang standard na nagtatakda nito. Sa praktika, nangangahulugan ito ng robots.txt na tumutukoy sa mga AI bot ayon sa layunin, mga opsyonal na file gaya ng llms.txt at isang API catalog, mga Markdown na bersyon ng mahahalagang page, at paraan para beripikahin ang mga pinapapasok mong agent. Sa mga ito, robots.txt at ang API catalog lang ang mga RFC na nailathala.

Binabasa ba ng mga AI crawler ang llms.txt?

Wala kaming dokumentasyon mula sa mga operator na nagsasabing kinukuha ito ng alinman sa mga crawler sa aming directory. Sinusuri ng Lighthouse kung umiiral ang file, at mababasa ito ng agent na itinuro mo rito gaya ng ibang page. Ituring ito bilang kaginhawahan para sa mga agent, hindi bilang feature para sa paghahanap.

Dapat ko bang harangan ang mga AI crawler sa site ko?

Magpasya ayon sa layunin, hindi nang sabay-sabay para sa lahat. Maaari mong tanggihan ang mga training token gaya ng GPTBot, ClaudeBot at Google-Extended nang hindi naaapektuhan ang paghahanap. Kapag hinarangan mo ang mga search token gaya ng OAI-SearchBot o PerplexityBot, hindi na maisasama ang site mo sa mga produktong iyon.

Maaari ko bang harangan ang ChatGPT agent gamit ang robots.txt?

Hindi, dahil wala itong inilalathalang token. Makikilala mo ito sa Web Bot Auth signature nito mula sa https://chatgpt.com at maaari mo itong payagan o tanggihan sa server o CDN mo. Pinatutunayan ng valid na signature kung aling operator ang nagpadala ng request, hindi kung sino ang user o kung ano ang maaari niyang gawin.

Opisyal bang standard ang Content-Signal?

Hindi. Isa itong patakaran ng Cloudflare na saklaw ng CC0, inilunsad noong September 2025 at inilalathala sa humigit-kumulang 3.8 million na domain sa pamamagitan ng pinamamahalaang robots.txt ng Cloudflare. Nag-expire ang IETF draft nito noong 4 April 2026, at binubuo pa rin ng AIPREF working group ang isang pinagsasaluhang bokabularyo.

Independent na sanggunian para sa mga gumagawa ng AI agent. Hindi kami kaanib ng alinman sa mga vendor na nakalista rito.

© 2026 DotsAgent · Sinuri ang mga detalye noong Oktubre 1, 2026