ทำให้เอเจนต์ AI อ่านเว็บไซต์ของคุณได้
ครอว์เลอร์และเอเจนต์ AI อ่านเว็บไซต์ของคุณไม่เหมือนกับคน เครื่องมือด้านล่างช่วยสร้างไฟล์ที่เอเจนต์เหล่านี้ค้นหา ส่วนข้อมูลอ้างอิงถัดไปจะอธิบายว่าข้อกำหนดใดเป็นมาตรฐาน ข้อกำหนดใดยังเป็นฉบับร่าง และมี client ใช้งานจริงกี่ราย
ตัวสร้าง llms.txt
กรอกชื่อ สรุป และส่วนต่าง ๆ ที่มีลิงก์ แล้วคัดลอกไฟล์ในรูปแบบ llmstxt.org
robots.txt สำหรับบอต AI
กำหนดนโยบายแยกตามวัตถุประสงค์ของบอต เปิดหรือปิดครอว์เลอร์แต่ละตัว เพิ่ม Content-Signal แล้วดาวน์โหลดผลลัพธ์
แค็ตตาล็อก API
ระบุ API พร้อมไฟล์ OpenAPI และเอกสารประกอบ เพื่อสร้าง linkset ตาม RFC 9727 พร้อมบล็อก nginx สำหรับให้บริการ
ไดเรกทอรีบอต AI
ข้อมูลครอว์เลอร์และเอเจนต์ 40 ราย พร้อม token วัตถุประสงค์ พฤติกรรมเมื่อพบ robots.txt และรายการ IP ที่เผยแพร่
ข้อกำหนดต่าง ๆ และสถานะความแพร่หลาย
สถานะ ณ เดือนตุลาคม 2026 แต่ละรายการมีลิงก์ไปยังข้อกำหนดหรือหลักฐานประกอบ เพื่อให้คุณประเมินได้ว่าคุ้มค่าหรือไม่ที่จะนำมาใช้กับเว็บไซต์ของคุณ
robots.txt มาตรฐาน
ไฟล์ที่อยู่ในรูทของเว็บไซต์ใช้ระบุครอว์เลอร์ตาม token และเส้นทางที่แต่ละตัวควรข้าม โดยมีมาตรฐานกำกับอยู่ใน RFC 9309 ปัจจุบันผู้ให้บริการ AI เผยแพร่ token แยกสำหรับการฝึก การค้นหา และการดึงข้อมูลตามคำขอของผู้ใช้ จึงใช้ไฟล์เดียวปฏิเสธการนำข้อมูลไปฝึก แต่ยังอนุญาตให้ค้นหาได้ การปฏิบัติตามข้อกำหนดนี้เป็นไปโดยสมัครใจ และบริการดึงข้อมูลตามคำขอของผู้ใช้บางรายระบุว่ากฎเหล่านี้อาจไม่มีผลกับบริการของตน
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal ใช้กันอย่างแพร่หลาย
เพิ่มบรรทัดใน robots.txt อีกหนึ่งบรรทัดเพื่อระบุว่าสามารถใช้เนื้อหาที่ดึงมาได้อย่างไร โดยกำหนด search, ai-input และ ai-train เป็น yes หรือ no อย่างละค่า Cloudflare เผยแพร่ข้อกำหนดนี้เป็นนโยบาย CC0 ในเดือนกันยายน 2025 และให้บริการบนโดเมนประมาณ 3.8 ล้านโดเมนผ่าน robots.txt ที่จัดการให้ ร่าง IETF ที่เกี่ยวข้องหมดอายุเมื่อ 4 เมษายน 2026 ขณะที่คณะทำงาน AIPREF ของ IETF ยังคงจัดทำร่างคำศัพท์ต่อไป
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt ข้อเสนอ
ไฟล์ Markdown ที่ /llms.txt ซึ่งมีชื่อใน H1 สรุปใน blockquote และส่วน H2 ที่รวมลิงก์ไว้ เพื่อให้ agent เข้าถึงหน้าสำคัญได้โดยไม่ต้องแยกวิเคราะห์เมนูนำทาง ข้อกำหนดที่ llmstxt.org ปรับปรุงเมื่อ 10 สิงหาคม 2026 และไม่ได้ระบุ llms-full.txt ไว้ด้วย เรายังไม่มีคำยืนยันจากผู้ให้บริการรายใดว่า crawler รายใหญ่ใช้ไฟล์นี้
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestหน้าเว็บเวอร์ชัน Markdown เริ่มใช้งานบางส่วน
เผยแพร่สำเนา Markdown ของแต่ละหน้าที่ page.md หรือ page.html.md หรือส่ง Markdown กลับเมื่อตรวจพบว่าคำขอมี Accept header ที่ระบุ text/markdown ในการทดสอบของ Checkly เมื่อเดือนกุมภาพันธ์ 2026 พบว่า Claude Code, Cursor และ OpenCode ส่ง header นี้ แต่ Codex, Gemini CLI, GitHub Copilot และ Windsurf ไม่ได้ส่ง AnswerShare นับคำขอจาก crawler ชั้นแนวหน้าได้ 1,277,965 รายการ และไม่มีรายการใดร้องขอ Markdown
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownแค็ตตาล็อก API มาตรฐาน
RFC 9727 ซึ่งเผยแพร่ในเดือนมิถุนายน 2025 กำหนดให้ /.well-known/api-catalog ใช้สำหรับแสดงรายการ API สาธารณะ โดยแต่ละรายการต้องลิงก์ไปยังคำอธิบายที่เครื่องอ่านได้ เอกสารประกอบ และหน้าสถานะ การตอบกลับต้องเป็น application/linkset+json และหน้าอื่น ๆ สามารถชี้มายังแค็ตตาล็อกนี้ด้วยความสัมพันธ์ลิงก์ api-catalog
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}คำขอจาก agent ที่มีลายเซ็น (Web Bot Auth) ร่าง
Agent ลงลายเซ็นให้แต่ละคำขอด้วย HTTP Message Signatures (RFC 9421) และระบุชื่อผู้ให้บริการใน Signature-Agent header คุณตรวจสอบลายเซ็นกับคีย์ที่ผู้ให้บริการเผยแพร่ไว้ที่ /.well-known/http-message-signatures-directory ได้ ร่างของคณะทำงาน IETF นี้ลงวันที่ 1 กันยายน 2026 ส่วน ChatGPT agent ลงลายเซ็นในชื่อ https://chatgpt.com อยู่แล้ว และ Google กำลังทดลองใช้ https://agent.bot.goog
Signature-Agent: "https://chatgpt.com"NLWeb ชะงัก
NLWeb ของ Microsoft ให้เว็บไซต์มี endpoint /ask และ /mcp ซึ่ง agents ใช้สอบถามด้วยภาษาธรรมชาติได้ โดยสเปกอยู่ที่เวอร์ชัน 0.55 Lumar รายงานว่าใบรับรองของ nlweb.ai หมดอายุเมื่อ 4 August 2026 และ repository ไม่มีความเคลื่อนไหวตั้งแต่ June จึงควรรอก่อนนำไปใช้เป็นพื้นฐาน
Agents ที่ไม่เปิดเผยตัว
Agents บางตัวไม่เผยแพร่ robots.txt token และเข้าชมเว็บไซต์เหมือนผู้ใช้ทั่วไป จึงไม่มีกฎ User-agent ที่ใช้ควบคุมได้ ChatGPT agent ลงนามในคำขอด้วย Web Bot Auth และส่ง Signature-Agent: "https://chatgpt.com" ซึ่งตรวจสอบได้กับไดเรกทอรีคีย์ของ OpenAI; Cloudflare ระบุทราฟฟิกนี้ว่า chatgpt-agent ส่วน Gemini Spark ในโหมด Chrome ภายในเครื่องและ Muse ของ Meta ไม่มีสัญญาณที่มีเอกสารรองรับ
คำถามเกี่ยวกับเว็บไซต์ที่พร้อมให้ agents ใช้งาน
เว็บไซต์แบบใดจึงพร้อมให้ agents ใช้งาน?
ไม่มีมาตรฐานเดียวที่กำหนดเรื่องนี้ ในทางปฏิบัติ หมายถึงมี robots.txt ที่ระบุ AI bots ตามวัตถุประสงค์ มีไฟล์เสริมอย่าง llms.txt และแค็ตตาล็อก API มีหน้า Markdown สำหรับหน้าสำคัญ และมีวิธียืนยันตัวตนของ agents ที่อนุญาตให้เข้าถึง ในบรรดาสิ่งเหล่านี้ มีเพียง robots.txt และแค็ตตาล็อก API ที่เป็น RFC ที่เผยแพร่แล้ว
AI crawlers อ่าน llms.txt หรือไม่?
เราไม่พบเอกสารจากผู้ให้บริการที่ระบุว่า crawler ในไดเรกทอรีของเราตัวใดดึงไฟล์นี้ Lighthouse ตรวจสอบว่ามีไฟล์อยู่หรือไม่ และ agent ที่คุณชี้ไปยังไฟล์นี้ก็อ่านได้เหมือนหน้าเว็บทั่วไป มองว่าไฟล์นี้ช่วยอำนวยความสะดวกให้ agents ไม่ใช่ฟีเจอร์สำหรับการค้นหา
ควรบล็อก AI crawlers บนเว็บไซต์หรือไม่?
ให้ตัดสินใจแยกตามวัตถุประสงค์ แทนที่จะบล็อกทั้งหมด token สำหรับการฝึกโมเดลอย่าง GPTBot, ClaudeBot และ Google-Extended สามารถปฏิเสธได้โดยไม่กระทบการค้นหา การบล็อก token สำหรับการค้นหาอย่าง OAI-SearchBot หรือ PerplexityBot จะทำให้เว็บไซต์ของคุณไม่ปรากฏในผลิตภัณฑ์เหล่านั้นเลย
บล็อก ChatGPT agent ด้วย robots.txt ได้หรือไม่?
ไม่ได้ เพราะไม่มีการเผยแพร่ token คุณตรวจจับได้จากลายเซ็น Web Bot Auth ของ https://chatgpt.com และอนุญาตหรือปฏิเสธคำขอได้ที่เซิร์ฟเวอร์หรือ CDN ของคุณ ลายเซ็นที่ถูกต้องยืนยันได้ว่าผู้ให้บริการรายใดส่งคำขอ แต่ไม่ยืนยันว่าผู้ใช้เป็นใครหรือผู้ใช้ทำอะไรได้บ้าง
Content-Signal เป็นมาตรฐานอย่างเป็นทางการหรือไม่?
ไม่ใช่ นี่คือนโยบาย CC0 จาก Cloudflare ซึ่งเปิดตัวใน September 2025 และให้บริการบนประมาณ 3.8 million โดเมนผ่าน robots.txt ที่ Cloudflare จัดการให้ IETF draft หมดอายุเมื่อ 4 April 2026 และคณะทำงาน AIPREF ยังคงร่างคำศัพท์กลางร่วมกัน