dotsagent.io
Lingua:Italiano
Apri il tuo sito · generatore

Generatore di robots.txt per bot AI

Scegli una policy per ogni tipo di bot AI, imposta eccezioni per singoli crawler e copia un file conforme a RFC 9309. Addestramento, ricerca e fetch avviati dagli utenti usano token distinti, così puoi bloccarne uno e consentirne un altro.

Inizia da
Addestramento

Bloccando questi bot, impedisci a questi operatori di usare le tue pagine per addestrare i modelli, senza modificare la loro presenza nei risultati di ricerca.

Ricerca

Bloccare anche questi bot blocca Googlebot e Applebot, escludendo il sito dai risultati di Google Search e di Siri, Spotlight e Safari di Apple.

Richieste degli utenti

Recuperano una pagina su richiesta di una persona e diversi operatori dichiarano che robots.txt potrebbe non essere applicabile. Bloccarli è quindi una richiesta, non una garanzia.

Agenti

Google-Agent in genere ignora robots.txt e la maggior parte degli agenti di navigazione non ha un token, quindi questo gruppo cambia poco nella pratica.

Fai clic su un bot per impostare l’opposto della policy del suo gruppo.

Content-Signal
search
ai-input
ai-train

Content-Signal specifica come possono essere usate le pagine recuperate: search per i risultati di ricerca, ai-input per generare risposte AI e ai-train per addestrare i modelli. Proviene dalla policy CC0 di Cloudflare ed esprime una preferenza senza bloccare nulla.

/robots.txt
# Crawler AI bloccati su tutto il sito
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: GoogleOther
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: MistralAI-Training
User-agent: CCBot
User-agent: Bytespider
User-agent: Timpibot
Disallow: /

# Crawler AI consentiti, percorsi privati esclusi
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: Googlebot
User-agent: Google-CloudVertexBot
User-agent: Google-Agent
User-agent: Google-GeminiNotebook
User-agent: Gemini-Deep-Research
User-agent: GoogleAgent-Mariner
User-agent: Applebot
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: meta-webindexer
User-agent: meta-externalfetcher
User-agent: facebookexternalhit
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: MistralAI-User
User-agent: MistralAI-Index
User-agent: cohere-ai
User-agent: YouBot
User-agent: Diffbot
Disallow: /admin/
Disallow: /api/

# Tutti gli altri crawler
User-agent: *
Content-Signal: search=yes, ai-input=yes, ai-train=no
Disallow: /admin/
Disallow: /api/

Sitemap: https://example.com/sitemap.xml

robots.txt è facoltativo. ChatGPT-User, Perplexity-User e altri fetcher attivati dagli utenti dichiarano che le regole potrebbero non essere applicabili e alcuni agenti non hanno affatto un token. Per applicare un blocco, confronta le richieste con gli elenchi di IP o le firme pubblicati e negale tramite il firewall o il WAF.

Vedi tutti i bot nella directory →

Come funziona il file generato

Un crawler segue il proprio gruppo

Un crawler che trova il proprio token in una riga User-agent segue quel gruppo e ignora le regole sotto User-agent: *. Ecco perché il generatore ripete i percorsi privati per i bot consentiti per nome e assegna ai bot bloccati un singolo Disallow: /.

Alcuni token non eseguono mai il crawling

Google-Extended e Applebot-Extended non hanno un proprio user agent. A recuperare i contenuti sono Googlebot e Applebot; i token estesi indicano a Google e Apple se possono usare quei contenuti per addestrare i propri modelli. Google applica inoltre Google-Extended al grounding di Gemini.

La maggior parte degli operatori separa training e ricerca

OpenAI, Anthropic, Amazon e Mistral usano token distinti per il training e la ricerca, quindi il preset No training mantiene il sito disponibile nei loro prodotti di ricerca. Meta fa eccezione: meta-externalagent si occupa sia del training sia dell'indicizzazione.

Applebot usa Googlebot come fallback

Se il file non contiene un gruppo Applebot, Apple dichiara che Applebot segue le regole di Googlebot. Applebot ignora anche Crawl-delay, così come Amazonbot, mentre Anthropic dichiara che ClaudeBot lo rispetta.

Domande su robots.txt e i bot AI

Come posso bloccare GPTBot senza uscire dalla ricerca di ChatGPT?

Imposta Disallow per GPTBot e lascia consentito OAI-SearchBot. GPTBot raccoglie dati per il training, OAI-SearchBot indicizza le pagine per la ricerca di ChatGPT e ChatGPT-User gestisce i recuperi richiesti da una persona. OpenAI documenta tutti e tre in un'unica pagina, ciascuno con il proprio elenco di IP.

Bloccare Google-Extended rimuove il sito da Google Search?

Google-Extended è un token di controllo senza un proprio user agent: il crawling è eseguito da Googlebot. Impostare Disallow per questo token indica a Google di non usare i contenuti per il training e il grounding di Gemini; le regole di Googlebot determinano invece quali contenuti vengono sottoposti a crawling per Search.

I crawler AI rispettano Crawl-delay?

Alcuni sì. Anthropic dichiara che ClaudeBot lo rispetta, mentre Apple e Amazon dichiarano che Applebot e Amazonbot non lo rispettano. Limitare il traffico sul server è l'opzione più affidabile.

Perché ChatGPT-User visita ancora il sito dopo che l'ho bloccato?

OpenAI dichiara che le regole di robots.txt potrebbero non essere applicabili a ChatGPT-User, perché la pagina è stata richiesta da una persona. Perplexity-User, Amzn-User e meta-externalfetcher presentano avvertenze simili. Se l'operatore pubblica un elenco di IP, confronta le richieste con l'elenco e bloccatele tramite il firewall.

A cosa serve Content-Signal in robots.txt?

Indica come possono essere usati i contenuti dopo il recupero, tramite tre segnali: search, ai-input e ai-train, impostati ciascuno su yes o no. Esprime una preferenza e non blocca nulla. Per impostazione predefinita, Markdown for Agents di Cloudflare aggiunge ai-train=yes, search=yes e ai-input=yes, quindi controlla l'output se usi questa funzionalità.

Fonti

  1. rfc-editor.org/rfc/rfc9309
  2. contentsignals.org/
  3. developers.google.com/search/docs/crawling-indexing/google-common-crawlers