Rendi il tuo sito leggibile dagli agenti AI
I crawler e gli agenti AI leggono il tuo sito in modo diverso dalle persone. Gli strumenti qui sotto generano i file che cercano; il riferimento che segue spiega quali convenzioni sono standard, quali sono bozze e quanti client le usano davvero.
Generatore llms.txt
Inserisci un nome, una descrizione e sezioni con link, poi copia un file nel formato llmstxt.org.
robots.txt per i bot AI
Imposta una policy per ogni scopo dei bot, attiva o disattiva i singoli crawler, aggiungi Content-Signal e scarica il risultato.
Catalogo API
Elenca le tue API con i relativi file OpenAPI e la documentazione per ottenere un linkset RFC 9727 e un blocco nginx per servirlo.
Directory dei bot AI
40 crawler e agenti con i rispettivi token, scopi, comportamento rispetto a robots.txt ed elenchi di IP pubblicati.
Le convenzioni e il loro grado di adozione
Stato a ottobre 2026. Ogni voce rimanda alla specifica o alle prove su cui si basa, così puoi valutare cosa vale la pena fare per il tuo sito.
robots.txt Standard
Il file nella root del sito identifica i crawler tramite token ed elenca i percorsi che ciascuno deve ignorare; è standardizzato come RFC 9309. Gli operatori AI pubblicano ora token separati per l'addestramento, la ricerca e il recupero dei contenuti su richiesta dell'utente, quindi un unico file può bloccare l'addestramento e consentire comunque la ricerca. Il rispetto delle regole è volontario e diversi sistemi di recupero attivati dall'utente dichiarano che potrebbero non essere tenuti a seguirle.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /Content-Signal Ampiamente utilizzato
Una riga in più in robots.txt che specifica come possono essere usati i contenuti recuperati: search, ai-input e ai-train, ciascuno impostato su yes o no. Cloudflare l'ha rilasciata come policy CC0 a settembre 2025 e la rende disponibile su circa 3.8 milioni di domini tramite il proprio robots.txt gestito. La bozza IETF corrispondente è scaduta il 4 April 2026, mentre il gruppo di lavoro IETF AIPREF prosegue con una bozza di vocabolario.
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /llms.txt Proposta
Un file Markdown in /llms.txt con un titolo H1, un riepilogo in blockquote e sezioni H2 con link, per consentire a un agent di raggiungere le pagine principali senza dover analizzare la navigazione. La specifica su llmstxt.org è stata aggiornata il 10 August 2026 e llms-full.txt non ne fa parte. Non abbiamo dichiarazioni di operatori che confermino che qualche crawler importante legga il file.
# Acme API
> Card payments for small online shops.
## Docs
- [Quickstart](https://example.com/docs/quickstart.md): first requestVersioni Markdown delle pagine Adozione parziale
Pubblica una copia Markdown di ogni pagina in page.md o page.html.md, oppure restituisci Markdown quando l'header Accept richiede text/markdown. Nel test di Checkly di February 2026, Claude Code, Cursor e OpenCode hanno inviato quell'header, mentre Codex, Gemini CLI, GitHub Copilot e Windsurf non l'hanno fatto. AnswerShare ha conteggiato 1,277,965 richieste da crawler frontier e nessuna di esse richiedeva Markdown.
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdownCatalogo API Standard
La RFC 9727, pubblicata a giugno 2025, riserva /.well-known/api-catalog a un elenco delle API pubbliche, ciascuna collegata alla relativa descrizione leggibile dalle macchine, alla documentazione e alla pagina di stato. La risposta deve essere application/linkset+json e le altre pagine possono rimandare al catalogo con la relazione di link api-catalog.
{
"linkset": [
{
"anchor": "https://api.example.com/v1",
"service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
}
]
}Richieste firmate dagli agent (Web Bot Auth) Bozza
Gli agent firmano ogni richiesta con HTTP Message Signatures (RFC 9421) e indicano il proprio operatore nell'header Signature-Agent. Verifica la firma usando le chiavi che l'operatore pubblica in /.well-known/http-message-signatures-directory. La bozza del gruppo di lavoro IETF è del 1 September 2026; l'agent di ChatGPT firma già come https://chatgpt.com e Google sta sperimentando https://agent.bot.goog.
Signature-Agent: "https://chatgpt.com"NLWeb In stallo
NLWeb di Microsoft fornisce a un sito gli endpoint /ask e /mcp, che gli agenti possono interrogare in linguaggio naturale; la specifica è alla versione 0.55. Lumar segnala che il certificato di nlweb.ai è scaduto il 4 August 2026 e che il repository è inattivo da giugno: meglio attendere prima di basarci un progetto.
Agenti che non si identificano
Alcuni agenti non pubblicano alcun token in robots.txt e navigano come farebbe un utente, quindi nessuna regola User-agent può intercettarli. L'agente ChatGPT firma le richieste con Web Bot Auth e invia Signature-Agent: "https://chatgpt.com"; puoi verificarlo consultando l'elenco delle chiavi di OpenAI. Cloudflare identifica questo traffico come chatgpt-agent. Gemini Spark in modalità Chrome locale e Muse di Meta non hanno alcun segnale documentato.
Domande sui siti pronti per gli agenti
Cosa rende un sito pronto per gli agenti?
Non esiste un unico standard che lo definisca. In pratica, significa avere un robots.txt che identifica i bot AI in base allo scopo, file facoltativi come llms.txt e un catalogo API, versioni Markdown delle pagine principali e un modo per verificare gli agenti a cui consenti l'accesso. Tra questi elementi, solo robots.txt e il catalogo API sono RFC pubblicate.
I crawler AI leggono llms.txt?
Non abbiamo documentazione degli operatori che confermi che un crawler del nostro elenco lo scarichi. Lighthouse verifica se il file esiste; un agente a cui indichi il file può leggerlo come qualsiasi altra pagina. Consideralo una comodità per gli agenti, non una funzionalità di ricerca.
Dovrei bloccare i crawler AI sul mio sito?
Decidi in base allo scopo, anziché bloccarli tutti in una volta. Puoi rifiutare i token usati per l'addestramento, come GPTBot, ClaudeBot e Google-Extended, senza compromettere la ricerca. Bloccare token usati per la ricerca, come OAI-SearchBot o PerplexityBot, ti esclude del tutto da quei prodotti.
Posso bloccare l'agente ChatGPT con robots.txt?
No, perché non pubblica alcun token. Puoi riconoscerlo dalla firma Web Bot Auth proveniente da https://chatgpt.com e consentirlo o negarlo sul server o sul CDN. Una firma valida dimostra quale operatore ha inviato la richiesta, non chi sia l'utente né cosa possa fare.
Content-Signal è uno standard ufficiale?
No. È una policy CC0 di Cloudflare, lanciata a settembre 2025 e distribuita su circa 3.8 million di domini tramite il robots.txt gestito da Cloudflare. La bozza IETF è scaduta il 4 April 2026 e il gruppo di lavoro AIPREF sta ancora definendo un vocabolario condiviso.