dotsagent.io
Lingua:Italiano
40 crawler e agenti

Elenco di crawler e agenti AI

Tutti i bot AI di cui siamo riusciti a verificare l'esistenza, con il token da usare in robots.txt, le pagine che recuperano, l'eventuale dichiarazione dell'operatore sul rispetto delle regole e i metodi per verificare che una richiesta provenga davvero da loro. I token noti solo grazie al registro comunitario ai.robots.txt sono indicati come tali nelle rispettive pagine.

BotTokenFinalitàRispetta robots.txtVerifica
GPTBot
OpenAI
GPTBotAddestramentoSìElenco IP
OAI-SearchBot
OpenAI
OAI-SearchBotRicercaSìElenco IP
ChatGPT-User
OpenAI
ChatGPT-UserRichieste degli utentiNoElenco IP
OAI-AdsBot
OpenAI
OAI-AdsBotAnnunciNon dichiaratoElenco IP
ChatGPT agent
OpenAI
Nessun tokenAgentiNon dichiaratoRichieste firmate
ClaudeBot
Anthropic
ClaudeBotAddestramentoSìElenco IP
Claude-SearchBot
Anthropic
Claude-SearchBotRicercaSìElenco IP
Claude-User
Anthropic
Claude-UserRichieste degli utentiSìElenco IP
Googlebot
Google
GooglebotRicercaSìElenco IP
Google-Extended
Google
Google-ExtendedAddestramentoSì—
Google-CloudVertexBot
Google
Google-CloudVertexBotRicercaSìElenco IP
GoogleOther
Google
GoogleOtherAddestramentoSìElenco IP
Google-Agent
Google
Google-AgentAgentiNoElenco IP
Google-GeminiNotebook
Google
Google-GeminiNotebookRichieste degli utentiNoElenco IP
Gemini Spark
Google
Nessun tokenAgentiNon dichiarato—
Gemini-Deep-Research
Google
Gemini-Deep-ResearchRichieste degli utentiNon dichiarato—
GoogleAgent-Mariner
Google
GoogleAgent-MarinerAgentiNon dichiarato—
Applebot
Apple
ApplebotRicercaSìElenco IP
Applebot-Extended
Apple
Applebot-ExtendedAddestramentoSì—
PerplexityBot
Perplexity
PerplexityBotRicercaSìElenco IP
Perplexity-User
Perplexity
Perplexity-UserRichieste degli utentiNoElenco IP
meta-externalagent
Meta
meta-externalagentAddestramentoSì—
meta-webindexer
Meta
meta-webindexerRicercaSì—
meta-externalfetcher
Meta
meta-externalfetcherRichieste degli utentiNo—
meta-externalads
Meta
meta-externaladsAnnunciSì—
facebookexternalhit
Meta
facebookexternalhitRichieste degli utentiNo—
Muse
Meta
Nessun tokenAgentiNon dichiarato—
Amazonbot
Amazon
AmazonbotAddestramentoSìElenco IP
Amzn-SearchBot
Amazon
Amzn-SearchBotRicercaSìElenco IP
Amzn-User
Amazon
Amzn-UserRichieste degli utentiNoElenco IP
DuckAssistBot
DuckDuckGo
DuckAssistBotRicercaSìElenco IP
MistralAI-User
Mistral
MistralAI-UserRichieste degli utentiSìElenco IP
MistralAI-Index
Mistral
MistralAI-IndexRicercaSìElenco IP
MistralAI-Training
Mistral
MistralAI-TrainingAddestramentoSì—
CCBot
Common Crawl
CCBotAddestramentoSìElenco IP
cohere-ai
Cohere
cohere-aiRichieste degli utentiNon dichiarato—
Bytespider
ByteDance
BytespiderAddestramentoNo—
YouBot
You.com
YouBotRicercaNon dichiarato—
Diffbot
Diffbot
DiffbotRicercaNon dichiarato—
Timpibot
Timpi
TimpibotAddestramentoNon dichiarato—

Significato delle finalità

Addestramento
Raccoglie pagine per addestrare modelli o per attività di crawling di ricerca generale. Google-Extended e Applebot-Extended sono token di controllo che non recuperano direttamente alcun contenuto.
Ricerca
Indicizza pagine per un prodotto di ricerca, da Google Search ai motori di risposta AI come ChatGPT search, Perplexity e DuckAssist. Se lo blocchi, il tuo sito non apparirà in quel prodotto.
Richieste degli utenti
Recupera una pagina su richiesta di una persona, in una chat o tramite uno strumento. Diversi operatori dichiarano che robots.txt potrebbe non essere applicabile a queste richieste.
Agenti
Naviga e agisce per conto dell'utente, spesso tramite un browser completo. Molti non hanno un token e possono essere identificati solo tramite firma, se possibile.
Annunci
Verifica le pagine di destinazione degli annunci inviate dagli inserzionisti. Questi bot non sono inclusi nel generatore di robots.txt.

Verifica che un bot sia davvero chi dice di essere

Una stringa user-agent si falsifica facilmente. La maggior parte dei grandi operatori pubblica gli intervalli IP usati dai propri bot in file JSON, indicati nella tabella come elenco IP. Confronta l'indirizzo della richiesta con l'elenco associato a quel token e considera non verificata una corrispondenza basata solo sul nome.

Alcuni operatori documentano anche il DNS inverso. Common Crawl, per esempio, dichiara che gli host di CCBot si risolvono in *.crawl.commoncrawl.org; prima di fidarti, verifica che il nome host si risolva di nuovo nello stesso indirizzo.

Gli agenti firmano sempre più spesso le richieste con HTTP Message Signatures (RFC 9421), secondo la bozza Web Bot Auth. La richiesta indica l'operatore in Signature-Agent e la verifica va eseguita con le chiavi pubbliche disponibili all'indirizzo /.well-known/http-message-signatures-directory del dominio. Una firma valida dimostra l'identità dell'operatore, non quella dell'utente né ciò che l'utente può fare.

Crea un robots.txt da questo elenco →

Domande sui crawler IA

Quali crawler IA ignorano robots.txt?

Secondo la documentazione dei rispettivi operatori, ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher e facebookexternalhit potrebbero non rispettarlo, soprattutto perché il recupero è stato richiesto da un utente. Secondo la community, Bytespider non lo rispetta.

Qual è la differenza tra GPTBot, OAI-SearchBot e ChatGPT-User?

GPTBot raccoglie pagine per addestrare i modelli OpenAI, OAI-SearchBot indicizza le pagine per la ricerca di ChatGPT e ChatGPT-User recupera una pagina su richiesta di una persona. I primi due rispettano robots.txt; OpenAI dichiara che le sue regole potrebbero non applicarsi al terzo.

Quali agenti IA non hanno un token robots.txt?

ChatGPT agent, Gemini Spark e Muse di Meta. ChatGPT agent può essere verificato tramite la sua firma Web Bot Auth proveniente da https://chatgpt.com. In modalità locale di Chrome, Gemini Spark si presenta come il browser dell'utente; Muse non ha uno user-agent pubblicato.

Come verifico che una richiesta provenga davvero da Googlebot?

Google pubblica gli intervalli IP di Googlebot in un file JSON, collegato dalla relativa voce in questa directory. Confronta l'indirizzo della richiesta con quegli intervalli, invece di fidarti della stringa user-agent.

Da dove proviene questo elenco di bot IA?

Ogni voce rimanda alla documentazione dell'operatore, se disponibile; i token senza documentazione provengono dal registro community ai.robots.txt. Abbiamo escluso DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin e PetalBot perché non abbiamo trovato documentazione dei rispettivi operatori. L'elenco è stato verificato il 1 ottobre 2026.