dotsagent.io
Język:Polski
Udostępnij swoją witrynę · materiały referencyjne

Przygotuj witrynę na odczyt przez agentów AI

Crawlery i agenci AI odczytują witryny inaczej niż ludzie. Poniższe narzędzia generują pliki, których szukają, a dalsza część materiałów wyjaśnia, które konwencje są standardami, które pozostają wersjami roboczymi i ilu klientów faktycznie z nich korzysta.

Konwencje i stopień ich ugruntowania

Stan na październik 2026. Każdy wpis zawiera link do specyfikacji lub źródeł, na których się opiera, aby ułatwić ocenę, co warto wdrożyć w swojej witrynie.

robots.txt Standard

Plik w katalogu głównym witryny identyfikuje crawlery za pomocą tokenów i wskazuje ścieżki, które każdy z nich powinien pomijać; jego format określa standard RFC 9309. Operatorzy AI publikują teraz osobne tokeny dla trenowania, wyszukiwania i pobierania treści na żądanie użytkownika, więc jeden plik może blokować trenowanie, a jednocześnie zezwalać na wyszukiwanie. Stosowanie się do tych zasad jest dobrowolne, a niektóre mechanizmy pobierania uruchamiane przez użytkownika informują, że zasady mogą ich nie dotyczyć.

/robots.txt
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

platform.openai.comdevelopers.google.com

Content-Signal Powszechnie stosowany

Jedna dodatkowa linia w robots.txt określająca, do czego można wykorzystywać pobraną treść: search, ai-input i ai-train — dla każdej z tych kategorii można ustawić yes lub no. Cloudflare opublikowało ją jako politykę na licencji CC0 we wrześniu 2025 r. i udostępnia ją w około 3.8 million domen za pośrednictwem zarządzanego pliku robots.txt. Powiązany projekt IETF wygasł 4 April 2026, a grupa robocza IETF AIPREF kontynuuje prace nad projektem słownika.

/robots.txt
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /

blog.cloudflare.comdatatracker.ietf.org

llms.txt Propozycja

Plik Markdown pod adresem /llms.txt z nazwą w nagłówku H1, podsumowaniem w cytacie blokowym i sekcjami H2 zawierającymi linki. Dzięki temu agent może dotrzeć do najważniejszych stron bez analizowania nawigacji. Specyfikacja na llmstxt.org została zmieniona 10 August 2026, a llms-full.txt nie jest jej częścią. Nie mamy oświadczeń operatorów potwierdzających, że którykolwiek z dużych crawlerów odczytuje ten plik.

/llms.txt
# Acme API

> Card payments for small online shops.

## Docs

- [Quickstart](https://example.com/docs/quickstart.md): first request

llmstxt.orgllmstxt.org

Wersje stron w Markdown Częściowe wdrożenie

Publikuj kopię każdej strony w Markdown pod adresem page.md lub page.html.md albo zwracaj Markdown na żądania, których nagłówek Accept wskazuje text/markdown. W teście Checkly z lutego 2026 r. Claude Code, Cursor i OpenCode wysyłały ten nagłówek, a Codex, Gemini CLI, GitHub Copilot i Windsurf — nie. AnswerShare zliczył 1,277,965 żądań od czołowych crawlerów i żadne z nich nie prosiło o Markdown.

Request
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdown

developers.cloudflare.comchecklyhq.comanswershare.com

Katalog API Standard

RFC 9727, opublikowany w czerwcu 2025 r., rezerwuje adres /.well-known/api-catalog na listę publicznych interfejsów API, z których każdy prowadzi do opisu czytelnego maszynowo, dokumentacji i strony statusu. Odpowiedź musi mieć typ application/linkset+json, a inne strony mogą wskazywać na ten katalog za pomocą relacji link api-catalog.

/.well-known/api-catalog
{
  "linkset": [
    {
      "anchor": "https://api.example.com/v1",
      "service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
    }
  ]
}

rfc-editor.org

Podpisywanie żądań agentów (Web Bot Auth) Projekt

Agenty podpisują każde żądanie za pomocą HTTP Message Signatures (RFC 9421) i podają nazwę operatora w nagłówku Signature-Agent. Weryfikujesz podpis za pomocą kluczy opublikowanych przez operatora pod adresem /.well-known/http-message-signatures-directory. Projekt grupy roboczej IETF datowany jest na 1 September 2026; agent ChatGPT już podpisuje żądania jako https://chatgpt.com, a Google testuje https://agent.bot.goog.

Request header
Signature-Agent: "https://chatgpt.com"

datatracker.ietf.orgblog.cloudflare.com

NLWeb Wstrzymany

NLWeb od Microsoft udostępnia witrynie endpointy /ask i /mcp, z których agenty mogą korzystać, zadając pytania w języku naturalnym. Specyfikacja ma wersję 0.55. Lumar informuje, że certyfikat nlweb.ai wygasł 4 August 2026, a repozytorium nie było aktywne od czerwca, więc wstrzymaj się z opieraniem na nim swoich rozwiązań.

github.comagentic-readiness.lumar.io

Agenty, które się nie identyfikują

Niektóre agenty nie publikują tokena w robots.txt i przeglądają internet tak jak użytkownik, więc żadna reguła User-agent nie może ich objąć. Agent ChatGPT podpisuje żądania za pomocą Web Bot Auth i wysyła nagłówek Signature-Agent: "https://chatgpt.com". Możesz zweryfikować ten podpis w katalogu kluczy OpenAI; Cloudflare oznacza ten ruch jako chatgpt-agent. Gemini Spark w lokalnym trybie Chrome oraz Muse od Meta nie mają żadnego udokumentowanego sygnału.

Pytania o witryny gotowe na agenty

Co sprawia, że witryna jest gotowa na agenty?

Nie ma jednej normy, która to definiuje. W praktyce oznacza to plik robots.txt z botami AI przypisanymi do konkretnych celów, opcjonalne pliki, takie jak llms.txt, katalog API, wersje kluczowych stron w Markdown oraz możliwość weryfikacji wpuszczanych agentów. Spośród tych elementów tylko robots.txt i katalog API są opublikowane jako RFC.

Czy crawlery AI odczytują llms.txt?

Nie znamy dokumentacji operatorów potwierdzającej, że którykolwiek crawler z naszego katalogu pobiera ten plik. Lighthouse sprawdza, czy plik istnieje, a agentowi, któremu wskażesz jego adres, można go udostępnić tak jak każdą inną stronę. Traktuj go jako udogodnienie dla agentów, a nie funkcję wyszukiwania.

Czy blokować crawlery AI w swojej witrynie?

Podejmuj decyzje osobno dla każdego celu, zamiast blokować wszystko naraz. Możesz odmówić dostępu botom szkoleniowym, takim jak GPTBot, ClaudeBot i Google-Extended, nie blokując wyszukiwania. Zablokowanie botów wyszukiwania, takich jak OAI-SearchBot czy PerplexityBot, całkowicie wykluczy Twoją witrynę z tych produktów.

Czy mogę zablokować agenta ChatGPT za pomocą robots.txt?

Nie, ponieważ agent ten nie publikuje tokena. Możesz go rozpoznać po podpisie Web Bot Auth z https://chatgpt.com i zezwolić na jego żądania albo je odrzucić na serwerze lub CDN. Prawidłowy podpis potwierdza, który operator wysłał żądanie, ale nie ujawnia tożsamości użytkownika ani zakresu jego uprawnień.

Czy Content-Signal to oficjalna norma?

Nie. To polityka Cloudflare na licencji CC0, opublikowana we September 2025 i udostępniana w około 3.8 million domen za pośrednictwem zarządzanego przez Cloudflare pliku robots.txt. Projekt IETF wygasł 4 April 2026, a grupa robocza AIPREF nadal opracowuje wspólny słownik.

Niezależne źródło informacji dla osób tworzących agentów AI. Nie jesteśmy powiązani z żadnym wymienionym tu dostawcą.

© 2026 DotsAgent · Dane sprawdzone 1 października 2026