Przygotuj witrynę na odczyt przez agentów AI
Crawlery i agenci AI odczytują witryny inaczej niż ludzie. Poniższe narzędzia generują pliki, których szukają, a dalsza część materiałów wyjaśnia, które konwencje są standardami, które pozostają wersjami roboczymi i ilu klientów faktycznie z nich korzysta.
Generator llms.txt
Podaj nazwę, podsumowanie i sekcje z linkami, a następnie skopiuj plik w formacie llmstxt.org.
robots.txt dla botów AI
Ustaw zasady dla każdego rodzaju bota, włączaj lub wyłączaj pojedyncze crawlery, dodaj Content-Signal i pobierz gotowy plik.
Katalog API
Wymień swoje API wraz z plikami OpenAPI i dokumentacją, aby otrzymać linkset zgodny z RFC 9727 oraz blok nginx do jego udostępniania.
Katalog botów AI
40 crawlerów i agentów wraz z ich tokenami, przeznaczeniem, obsługą robots.txt i opublikowanymi listami adresów IP.
Konwencje i stopień ich ugruntowania
Stan na październik 2026. Każdy wpis zawiera link do specyfikacji lub źródeł, na których się opiera, aby ułatwić ocenę, co warto wdrożyć w swojej witrynie.
robots.txt Standard
Plik w katalogu głównym witryny identyfikuje crawlery za pomocą tokenów i wskazuje ścieżki, które każdy z nich powinien pomijać; jego format określa standard RFC 9309. Operatorzy AI publikują teraz osobne tokeny dla trenowania, wyszukiwania i pobierania treści na żądanie użytkownika, więc jeden plik może blokować trenowanie, a jednocześnie zezwalać na wyszukiwanie. Stosowanie się do tych zasad jest dobrowolne, a niektóre mechanizmy pobierania uruchamiane przez użytkownika informują, że zasady mogą ich nie dotyczyć.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal Powszechnie stosowany
Jedna dodatkowa linia w robots.txt określająca, do czego można wykorzystywać pobraną treść: search, ai-input i ai-train — dla każdej z tych kategorii można ustawić yes lub no. Cloudflare opublikowało ją jako politykę na licencji CC0 we wrześniu 2025 r. i udostępnia ją w około 3.8 million domen za pośrednictwem zarządzanego pliku robots.txt. Powiązany projekt IETF wygasł 4 April 2026, a grupa robocza IETF AIPREF kontynuuje prace nad projektem słownika.
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt Propozycja
Plik Markdown pod adresem /llms.txt z nazwą w nagłówku H1, podsumowaniem w cytacie blokowym i sekcjami H2 zawierającymi linki. Dzięki temu agent może dotrzeć do najważniejszych stron bez analizowania nawigacji. Specyfikacja na llmstxt.org została zmieniona 10 August 2026, a llms-full.txt nie jest jej częścią. Nie mamy oświadczeń operatorów potwierdzających, że którykolwiek z dużych crawlerów odczytuje ten plik.
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestWersje stron w Markdown Częściowe wdrożenie
Publikuj kopię każdej strony w Markdown pod adresem page.md lub page.html.md albo zwracaj Markdown na żądania, których nagłówek Accept wskazuje text/markdown. W teście Checkly z lutego 2026 r. Claude Code, Cursor i OpenCode wysyłały ten nagłówek, a Codex, Gemini CLI, GitHub Copilot i Windsurf — nie. AnswerShare zliczył 1,277,965 żądań od czołowych crawlerów i żadne z nich nie prosiło o Markdown.
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownKatalog API Standard
RFC 9727, opublikowany w czerwcu 2025 r., rezerwuje adres /.well-known/api-catalog na listę publicznych interfejsów API, z których każdy prowadzi do opisu czytelnego maszynowo, dokumentacji i strony statusu. Odpowiedź musi mieć typ application/linkset+json, a inne strony mogą wskazywać na ten katalog za pomocą relacji link api-catalog.
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}Podpisywanie żądań agentów (Web Bot Auth) Projekt
Agenty podpisują każde żądanie za pomocą HTTP Message Signatures (RFC 9421) i podają nazwę operatora w nagłówku Signature-Agent. Weryfikujesz podpis za pomocą kluczy opublikowanych przez operatora pod adresem /.well-known/http-message-signatures-directory. Projekt grupy roboczej IETF datowany jest na 1 September 2026; agent ChatGPT już podpisuje żądania jako https://chatgpt.com, a Google testuje https://agent.bot.goog.
Signature-Agent: "https://chatgpt.com"NLWeb Wstrzymany
NLWeb od Microsoft udostępnia witrynie endpointy /ask i /mcp, z których agenty mogą korzystać, zadając pytania w języku naturalnym. Specyfikacja ma wersję 0.55. Lumar informuje, że certyfikat nlweb.ai wygasł 4 August 2026, a repozytorium nie było aktywne od czerwca, więc wstrzymaj się z opieraniem na nim swoich rozwiązań.
Agenty, które się nie identyfikują
Niektóre agenty nie publikują tokena w robots.txt i przeglądają internet tak jak użytkownik, więc żadna reguła User-agent nie może ich objąć. Agent ChatGPT podpisuje żądania za pomocą Web Bot Auth i wysyła nagłówek Signature-Agent: "https://chatgpt.com". Możesz zweryfikować ten podpis w katalogu kluczy OpenAI; Cloudflare oznacza ten ruch jako chatgpt-agent. Gemini Spark w lokalnym trybie Chrome oraz Muse od Meta nie mają żadnego udokumentowanego sygnału.
Pytania o witryny gotowe na agenty
Co sprawia, że witryna jest gotowa na agenty?
Nie ma jednej normy, która to definiuje. W praktyce oznacza to plik robots.txt z botami AI przypisanymi do konkretnych celów, opcjonalne pliki, takie jak llms.txt, katalog API, wersje kluczowych stron w Markdown oraz możliwość weryfikacji wpuszczanych agentów. Spośród tych elementów tylko robots.txt i katalog API są opublikowane jako RFC.
Czy crawlery AI odczytują llms.txt?
Nie znamy dokumentacji operatorów potwierdzającej, że którykolwiek crawler z naszego katalogu pobiera ten plik. Lighthouse sprawdza, czy plik istnieje, a agentowi, któremu wskażesz jego adres, można go udostępnić tak jak każdą inną stronę. Traktuj go jako udogodnienie dla agentów, a nie funkcję wyszukiwania.
Czy blokować crawlery AI w swojej witrynie?
Podejmuj decyzje osobno dla każdego celu, zamiast blokować wszystko naraz. Możesz odmówić dostępu botom szkoleniowym, takim jak GPTBot, ClaudeBot i Google-Extended, nie blokując wyszukiwania. Zablokowanie botów wyszukiwania, takich jak OAI-SearchBot czy PerplexityBot, całkowicie wykluczy Twoją witrynę z tych produktów.
Czy mogę zablokować agenta ChatGPT za pomocą robots.txt?
Nie, ponieważ agent ten nie publikuje tokena. Możesz go rozpoznać po podpisie Web Bot Auth z https://chatgpt.com i zezwolić na jego żądania albo je odrzucić na serwerze lub CDN. Prawidłowy podpis potwierdza, który operator wysłał żądanie, ale nie ujawnia tożsamości użytkownika ani zakresu jego uprawnień.
Czy Content-Signal to oficjalna norma?
Nie. To polityka Cloudflare na licencji CC0, opublikowana we September 2025 i udostępniana w około 3.8 million domen za pośrednictwem zarządzanego przez Cloudflare pliku robots.txt. Projekt IETF wygasł 4 April 2026, a grupa robocza AIPREF nadal opracowuje wspólny słownik.