---
title: "Generatore di robots.txt per crawler e agenti AI · DotsAgent"
description: "Crea un robots.txt che blocca l’addestramento dei modelli AI senza impedire la ricerca: 35 token dei bot raggruppati per scopo, righe Content-Signal, percorsi privati e riga sitemap."
url: https://dotsagent.io/it/agent-ready/robots-txt
---

Apri il tuo sito · generatore

# Generatore di robots.txt per bot AI

Scegli una policy per ogni tipo di bot AI, imposta eccezioni per singoli crawler e copia un file conforme a RFC 9309. Addestramento, ricerca e fetch avviati dagli utenti usano token distinti, così puoi bloccarne uno e consentirne un altro.

`/robots.txt`

```
# Crawler AI bloccati su tutto il sito
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Crawler AI consentiti, percorsi privati esclusi
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Tutti gli altri crawler
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml
```

robots.txt è facoltativo. ChatGPT-User, Perplexity-User e altri fetcher attivati dagli utenti dichiarano che le regole potrebbero non essere applicabili e alcuni agenti non hanno affatto un token. Per applicare un blocco, confronta le richieste con gli elenchi di IP o le firme pubblicati e negale tramite il firewall o il WAF.

[Vedi tutti i bot nella directory →](https://dotsagent.io/it/agent-ready/bots)

## Come funziona il file generato

### Un crawler segue il proprio gruppo

Un crawler che trova il proprio token in una riga User-agent segue quel gruppo e ignora le regole sotto User-agent: *. Ecco perché il generatore ripete i percorsi privati per i bot consentiti per nome e assegna ai bot bloccati un singolo Disallow: /.

### Alcuni token non eseguono mai il crawling

Google-Extended e Applebot-Extended non hanno un proprio user agent. A recuperare i contenuti sono Googlebot e Applebot; i token estesi indicano a Google e Apple se possono usare quei contenuti per addestrare i propri modelli. Google applica inoltre Google-Extended al grounding di Gemini.

### La maggior parte degli operatori separa training e ricerca

OpenAI, Anthropic, Amazon e Mistral usano token distinti per il training e la ricerca, quindi il preset No training mantiene il sito disponibile nei loro prodotti di ricerca. Meta fa eccezione: meta-externalagent si occupa sia del training sia dell'indicizzazione.

### Applebot usa Googlebot come fallback

Se il file non contiene un gruppo Applebot, Apple dichiara che Applebot segue le regole di Googlebot. Applebot ignora anche Crawl-delay, così come Amazonbot, mentre Anthropic dichiara che ClaudeBot lo rispetta.

## Domande su robots.txt e i bot AI

### Come posso bloccare GPTBot senza uscire dalla ricerca di ChatGPT?

Imposta Disallow per GPTBot e lascia consentito OAI-SearchBot. GPTBot raccoglie dati per il training, OAI-SearchBot indicizza le pagine per la ricerca di ChatGPT e ChatGPT-User gestisce i recuperi richiesti da una persona. OpenAI documenta tutti e tre in un'unica pagina, ciascuno con il proprio elenco di IP.

### Bloccare Google-Extended rimuove il sito da Google Search?

Google-Extended è un token di controllo senza un proprio user agent: il crawling è eseguito da Googlebot. Impostare Disallow per questo token indica a Google di non usare i contenuti per il training e il grounding di Gemini; le regole di Googlebot determinano invece quali contenuti vengono sottoposti a crawling per Search.

### I crawler AI rispettano Crawl-delay?

Alcuni sì. Anthropic dichiara che ClaudeBot lo rispetta, mentre Apple e Amazon dichiarano che Applebot e Amazonbot non lo rispettano. Limitare il traffico sul server è l'opzione più affidabile.

### Perché ChatGPT-User visita ancora il sito dopo che l'ho bloccato?

OpenAI dichiara che le regole di robots.txt potrebbero non essere applicabili a ChatGPT-User, perché la pagina è stata richiesta da una persona. Perplexity-User, Amzn-User e meta-externalfetcher presentano avvertenze simili. Se l'operatore pubblica un elenco di IP, confronta le richieste con l'elenco e bloccatele tramite il firewall.

### A cosa serve Content-Signal in robots.txt?

Indica come possono essere usati i contenuti dopo il recupero, tramite tre segnali: search, ai-input e ai-train, impostati ciascuno su yes o no. Esprime una preferenza e non blocca nulla. Per impostazione predefinita, Markdown for Agents di Cloudflare aggiunge ai-train=yes, search=yes e ai-input=yes, quindi controlla l'output se usi questa funzionalità.

## Fonti

1. [rfc-editor.org](https://www.rfc-editor.org/rfc/rfc9309)/rfc/rfc9309
2. [contentsignals.org](https://contentsignals.org/)/
3. [developers.google.com](https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers)/search/docs/crawling-indexing/google-common-crawlers

Riferimento indipendente per chi sviluppa agenti IA. Non siamo affiliati a nessun fornitore citato qui.

© 2026 DotsAgent · Dati verificati il 1 ottobre 2026
