Generatore di robots.txt per bot AI
Scegli una policy per ogni tipo di bot AI, imposta eccezioni per singoli crawler e copia un file conforme a RFC 9309. Addestramento, ricerca e fetch avviati dagli utenti usano token distinti, così puoi bloccarne uno e consentirne un altro.
# Crawler AI bloccati su tutto il sito
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /
# Crawler AI consentiti, percorsi privati esclusi
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/
# Tutti gli altri crawler
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/
Sitemap: https://example.com/sitemap.xml
robots.txt è facoltativo. ChatGPT-User, Perplexity-User e altri fetcher attivati dagli utenti dichiarano che le regole potrebbero non essere applicabili e alcuni agenti non hanno affatto un token. Per applicare un blocco, confronta le richieste con gli elenchi di IP o le firme pubblicati e negale tramite il firewall o il WAF.
Come funziona il file generato
Un crawler segue il proprio gruppo
Un crawler che trova il proprio token in una riga User-agent segue quel gruppo e ignora le regole sotto User-agent: *. Ecco perché il generatore ripete i percorsi privati per i bot consentiti per nome e assegna ai bot bloccati un singolo Disallow: /.
Alcuni token non eseguono mai il crawling
Google-Extended e Applebot-Extended non hanno un proprio user agent. A recuperare i contenuti sono Googlebot e Applebot; i token estesi indicano a Google e Apple se possono usare quei contenuti per addestrare i propri modelli. Google applica inoltre Google-Extended al grounding di Gemini.
La maggior parte degli operatori separa training e ricerca
OpenAI, Anthropic, Amazon e Mistral usano token distinti per il training e la ricerca, quindi il preset No training mantiene il sito disponibile nei loro prodotti di ricerca. Meta fa eccezione: meta-externalagent si occupa sia del training sia dell'indicizzazione.
Applebot usa Googlebot come fallback
Se il file non contiene un gruppo Applebot, Apple dichiara che Applebot segue le regole di Googlebot. Applebot ignora anche Crawl-delay, così come Amazonbot, mentre Anthropic dichiara che ClaudeBot lo rispetta.
Domande su robots.txt e i bot AI
Come posso bloccare GPTBot senza uscire dalla ricerca di ChatGPT?
Imposta Disallow per GPTBot e lascia consentito OAI-SearchBot. GPTBot raccoglie dati per il training, OAI-SearchBot indicizza le pagine per la ricerca di ChatGPT e ChatGPT-User gestisce i recuperi richiesti da una persona. OpenAI documenta tutti e tre in un'unica pagina, ciascuno con il proprio elenco di IP.
Bloccare Google-Extended rimuove il sito da Google Search?
Google-Extended è un token di controllo senza un proprio user agent: il crawling è eseguito da Googlebot. Impostare Disallow per questo token indica a Google di non usare i contenuti per il training e il grounding di Gemini; le regole di Googlebot determinano invece quali contenuti vengono sottoposti a crawling per Search.
I crawler AI rispettano Crawl-delay?
Alcuni sì. Anthropic dichiara che ClaudeBot lo rispetta, mentre Apple e Amazon dichiarano che Applebot e Amazonbot non lo rispettano. Limitare il traffico sul server è l'opzione più affidabile.
Perché ChatGPT-User visita ancora il sito dopo che l'ho bloccato?
OpenAI dichiara che le regole di robots.txt potrebbero non essere applicabili a ChatGPT-User, perché la pagina è stata richiesta da una persona. Perplexity-User, Amzn-User e meta-externalfetcher presentano avvertenze simili. Se l'operatore pubblica un elenco di IP, confronta le richieste con l'elenco e bloccatele tramite il firewall.
A cosa serve Content-Signal in robots.txt?
Indica come possono essere usati i contenuti dopo il recupero, tramite tre segnali: search, ai-input e ai-train, impostati ciascuno su yes o no. Esprime una preferenza e non blocca nulla. Per impostazione predefinita, Markdown for Agents di Cloudflare aggiunge ai-train=yes, search=yes e ai-input=yes, quindi controlla l'output se usi questa funzionalità.