---
title: "Siti pronti per gli agenti: llms.txt, robots.txt, bot AI · DotsAgent"
description: "Genera llms.txt, un robots.txt per i bot AI e un catalogo API RFC 9727. Consulta poi 40 crawler e agenti AI per token, scopo ed elenco di IP pubblicati."
url: https://dotsagent.io/it/agent-ready
---

Apri il tuo sito · riferimento

# Rendi il tuo sito leggibile dagli agenti AI

I crawler e gli agenti AI leggono il tuo sito in modo diverso dalle persone. Gli strumenti qui sotto generano i file che cercano; il riferimento che segue spiega quali convenzioni sono standard, quali sono bozze e quanti client le usano davvero.

- [Generatore llms.txt](https://dotsagent.io/it/agent-ready/llms-txt): Inserisci un nome, una descrizione e sezioni con link, poi copia un file nel formato llmstxt.org.

- [robots.txt per i bot AI](https://dotsagent.io/it/agent-ready/robots-txt): Imposta una policy per ogni scopo dei bot, attiva o disattiva i singoli crawler, aggiungi Content-Signal e scarica il risultato.

- [Catalogo API](https://dotsagent.io/it/agent-ready/api-catalog): Elenca le tue API con i relativi file OpenAPI e la documentazione per ottenere un linkset RFC 9727 e un blocco nginx per servirlo.

- [Directory dei bot AI](https://dotsagent.io/it/agent-ready/bots): 40 crawler e agenti con i rispettivi token, scopi, comportamento rispetto a robots.txt ed elenchi di IP pubblicati.

## Le convenzioni e il loro grado di adozione

Stato a ottobre 2026. Ogni voce rimanda alla specifica o alle prove su cui si basa, così puoi valutare cosa vale la pena fare per il tuo sito.

### robots.txt Standard

Il file nella root del sito identifica i crawler tramite token ed elenca i percorsi che ciascuno deve ignorare; è standardizzato come RFC 9309. Gli operatori AI pubblicano ora token separati per l'addestramento, la ricerca e il recupero dei contenuti su richiesta dell'utente, quindi un unico file può bloccare l'addestramento e consentire comunque la ricerca. Il rispetto delle regole è volontario e diversi sistemi di recupero attivati dall'utente dichiarano che potrebbero non essere tenuti a seguirle.

`/robots.txt`

```
User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /
```

[platform.openai.com](https://platform.openai.com/docs/bots)[developers.google.com](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)

### Content-Signal Ampiamente utilizzato

Una riga in più in robots.txt che specifica come possono essere usati i contenuti recuperati: search, ai-input e ai-train, ciascuno impostato su yes o no. Cloudflare l'ha rilasciata come policy CC0 a settembre 2025 e la rende disponibile su circa 3.8 milioni di domini tramite il proprio robots.txt gestito. La bozza IETF corrispondente è scaduta il 4 April 2026, mentre il gruppo di lavoro IETF AIPREF prosegue con una bozza di vocabolario.

`/robots.txt`

```
User-agent: *
Content-Signal: ai-train=no, search=yes, ai-input=yes
Allow: /
```

[blog.cloudflare.com](https://blog.cloudflare.com/content-signals-policy/)[datatracker.ietf.org](https://datatracker.ietf.org/wg/aipref/documents/)

### llms.txt Proposta

Un file Markdown in /llms.txt con un titolo H1, un riepilogo in blockquote e sezioni H2 con link, per consentire a un agent di raggiungere le pagine principali senza dover analizzare la navigazione. La specifica su llmstxt.org è stata aggiornata il 10 August 2026 e llms-full.txt non ne fa parte. Non abbiamo dichiarazioni di operatori che confermino che qualche crawler importante legga il file.

`/llms.txt`

```
# Acme API

> Card payments for small online shops.

## Docs

- [Quickstart](https://example.com/docs/quickstart.md): first request
```

[llmstxt.org](https://llmstxt.org/)[llmstxt.org](https://llmstxt.org/changes.html)

### Versioni Markdown delle pagine Adozione parziale

Pubblica una copia Markdown di ogni pagina in page.md o page.html.md, oppure restituisci Markdown quando l'header Accept richiede text/markdown. Nel test di Checkly di February 2026, Claude Code, Cursor e OpenCode hanno inviato quell'header, mentre Codex, Gemini CLI, GitHub Copilot e Windsurf non l'hanno fatto. AnswerShare ha conteggiato 1,277,965 richieste da crawler frontier e nessuna di esse richiedeva Markdown.

`Request`

```
GET /docs/quickstart HTTP/1.1
Host: example.com
Accept: text/markdown
```

[developers.cloudflare.com](https://developers.cloudflare.com/fundamentals/reference/markdown-for-agents/)[checklyhq.com](https://www.checklyhq.com/blog/state-of-ai-agent-content-negotation/)[answershare.com](https://answershare.com/markdowndoesnotwork)

### Catalogo API Standard

La RFC 9727, pubblicata a giugno 2025, riserva /.well-known/api-catalog a un elenco delle API pubbliche, ciascuna collegata alla relativa descrizione leggibile dalle macchine, alla documentazione e alla pagina di stato. La risposta deve essere application/linkset+json e le altre pagine possono rimandare al catalogo con la relazione di link api-catalog.

`/.well-known/api-catalog`

```
{
  "linkset": [
    {
      "anchor": "https://api.example.com/v1",
      "service-desc": [{ "href": "https://api.example.com/v1/openapi.json" }]
    }
  ]
}
```

[rfc-editor.org](https://www.rfc-editor.org/rfc/rfc9727.html)

### Richieste firmate dagli agent (Web Bot Auth) Bozza

Gli agent firmano ogni richiesta con HTTP Message Signatures (RFC 9421) e indicano il proprio operatore nell'header Signature-Agent. Verifica la firma usando le chiavi che l'operatore pubblica in /.well-known/http-message-signatures-directory. La bozza del gruppo di lavoro IETF è del 1 September 2026; l'agent di ChatGPT firma già come https://chatgpt.com e Google sta sperimentando https://agent.bot.goog.

`Request header`

```
Signature-Agent: "https://chatgpt.com"
```

[datatracker.ietf.org](https://datatracker.ietf.org/doc/draft-ietf-webbotauth-httpsig-protocol/)[blog.cloudflare.com](https://blog.cloudflare.com/signed-agents/)

### NLWeb In stallo

NLWeb di Microsoft fornisce a un sito gli endpoint /ask e /mcp, che gli agenti possono interrogare in linguaggio naturale; la specifica è alla versione 0.55. Lumar segnala che il certificato di nlweb.ai è scaduto il 4 August 2026 e che il repository è inattivo da giugno: meglio attendere prima di basarci un progetto.

[github.com](https://github.com/microsoft/NLWeb/blob/main/docs/nlweb-rest-api.md)[agentic-readiness.lumar.io](https://agentic-readiness.lumar.io/docs/capabilities/nl-web)

## Agenti che non si identificano

Alcuni agenti non pubblicano alcun token in robots.txt e navigano come farebbe un utente, quindi nessuna regola User-agent può intercettarli. L'agente ChatGPT firma le richieste con Web Bot Auth e invia Signature-Agent: "https://chatgpt.com"; puoi verificarlo consultando l'elenco delle chiavi di OpenAI. Cloudflare identifica questo traffico come chatgpt-agent. Gemini Spark in modalità Chrome locale e Muse di Meta non hanno alcun segnale documentato.

## Domande sui siti pronti per gli agenti

### Cosa rende un sito pronto per gli agenti?

Non esiste un unico standard che lo definisca. In pratica, significa avere un robots.txt che identifica i bot AI in base allo scopo, file facoltativi come llms.txt e un catalogo API, versioni Markdown delle pagine principali e un modo per verificare gli agenti a cui consenti l'accesso. Tra questi elementi, solo robots.txt e il catalogo API sono RFC pubblicate.

### I crawler AI leggono llms.txt?

Non abbiamo documentazione degli operatori che confermi che un crawler del nostro elenco lo scarichi. Lighthouse verifica se il file esiste; un agente a cui indichi il file può leggerlo come qualsiasi altra pagina. Consideralo una comodità per gli agenti, non una funzionalità di ricerca.

### Dovrei bloccare i crawler AI sul mio sito?

Decidi in base allo scopo, anziché bloccarli tutti in una volta. Puoi rifiutare i token usati per l'addestramento, come GPTBot, ClaudeBot e Google-Extended, senza compromettere la ricerca. Bloccare token usati per la ricerca, come OAI-SearchBot o PerplexityBot, ti esclude del tutto da quei prodotti.

### Posso bloccare l'agente ChatGPT con robots.txt?

No, perché non pubblica alcun token. Puoi riconoscerlo dalla firma Web Bot Auth proveniente da https://chatgpt.com e consentirlo o negarlo sul server o sul CDN. Una firma valida dimostra quale operatore ha inviato la richiesta, non chi sia l'utente né cosa possa fare.

### Content-Signal è uno standard ufficiale?

No. È una policy CC0 di Cloudflare, lanciata a settembre 2025 e distribuita su circa 3.8 million di domini tramite il robots.txt gestito da Cloudflare. La bozza IETF è scaduta il 4 April 2026 e il gruppo di lavoro AIPREF sta ancora definendo un vocabolario condiviso.

Riferimento indipendente per chi sviluppa agenti IA. Non siamo affiliati a nessun fornitore citato qui.

© 2026 DotsAgent · Dati verificati il 1 ottobre 2026
