---
title: "Directory dei bot AI: 40 crawler, token ed elenchi IP · DotsAgent"
description: "40 crawler e agenti AI di OpenAI, Anthropic, Google, Apple, Meta, Amazon e altri, con token per robots.txt, finalità, rispetto delle regole ed elenchi IP."
url: https://dotsagent.io/it/agent-ready/bots
---

40 crawler e agenti

# Elenco di crawler e agenti AI

Tutti i bot AI di cui siamo riusciti a verificare l'esistenza, con il token da usare in robots.txt, le pagine che recuperano, l'eventuale dichiarazione dell'operatore sul rispetto delle regole e i metodi per verificare che una richiesta provenga davvero da loro. I token noti solo grazie al registro comunitario ai.robots.txt sono indicati come tali nelle rispettive pagine.

| Bot | Token | Finalità | Rispetta robots.txt | Verifica |
| --- | --- | --- | --- | --- |
| [GPTBot](https://dotsagent.io/it/agent-ready/bots/gptbot)OpenAI | `GPTBot` | Addestramento | — | Elenco IP |
| [OAI-SearchBot](https://dotsagent.io/it/agent-ready/bots/oai-searchbot)OpenAI | `OAI-SearchBot` | Ricerca | — | Elenco IP |
| [ChatGPT-User](https://dotsagent.io/it/agent-ready/bots/chatgpt-user)OpenAI | `ChatGPT-User` | Richieste degli utenti | — | Elenco IP |
| [OAI-AdsBot](https://dotsagent.io/it/agent-ready/bots/oai-adsbot)OpenAI | `OAI-AdsBot` | Annunci | — | Elenco IP |
| [ChatGPT agent](https://dotsagent.io/it/agent-ready/bots/chatgpt-agent)OpenAI | Nessun token | Agenti | — | Richieste firmate |
| [ClaudeBot](https://dotsagent.io/it/agent-ready/bots/claudebot)Anthropic | `ClaudeBot` | Addestramento | — | Elenco IP |
| [Claude-SearchBot](https://dotsagent.io/it/agent-ready/bots/claude-searchbot)Anthropic | `Claude-SearchBot` | Ricerca | — | Elenco IP |
| [Claude-User](https://dotsagent.io/it/agent-ready/bots/claude-user)Anthropic | `Claude-User` | Richieste degli utenti | — | Elenco IP |
| [Googlebot](https://dotsagent.io/it/agent-ready/bots/googlebot)Google | `Googlebot` | Ricerca | — | Elenco IP |
| [Google-Extended](https://dotsagent.io/it/agent-ready/bots/google-extended)Google | `Google-Extended` | Addestramento | — | — |
| [Google-CloudVertexBot](https://dotsagent.io/it/agent-ready/bots/google-cloudvertexbot)Google | `Google-CloudVertexBot` | Ricerca | — | Elenco IP |
| [GoogleOther](https://dotsagent.io/it/agent-ready/bots/googleother)Google | `GoogleOther` | Addestramento | — | Elenco IP |
| [Google-Agent](https://dotsagent.io/it/agent-ready/bots/google-agent)Google | `Google-Agent` | Agenti | — | Elenco IP |
| [Google-GeminiNotebook](https://dotsagent.io/it/agent-ready/bots/google-gemininotebook)Google | `Google-GeminiNotebook` | Richieste degli utenti | — | Elenco IP |
| [Gemini Spark](https://dotsagent.io/it/agent-ready/bots/gemini-spark)Google | Nessun token | Agenti | — | — |
| [Gemini-Deep-Research](https://dotsagent.io/it/agent-ready/bots/gemini-deep-research)Google | `Gemini-Deep-Research` | Richieste degli utenti | — | — |
| [GoogleAgent-Mariner](https://dotsagent.io/it/agent-ready/bots/googleagent-mariner)Google | `GoogleAgent-Mariner` | Agenti | — | — |
| [Applebot](https://dotsagent.io/it/agent-ready/bots/applebot)Apple | `Applebot` | Ricerca | — | Elenco IP |
| [Applebot-Extended](https://dotsagent.io/it/agent-ready/bots/applebot-extended)Apple | `Applebot-Extended` | Addestramento | — | — |
| [PerplexityBot](https://dotsagent.io/it/agent-ready/bots/perplexitybot)Perplexity | `PerplexityBot` | Ricerca | — | Elenco IP |
| [Perplexity-User](https://dotsagent.io/it/agent-ready/bots/perplexity-user)Perplexity | `Perplexity-User` | Richieste degli utenti | — | Elenco IP |
| [meta-externalagent](https://dotsagent.io/it/agent-ready/bots/meta-externalagent)Meta | `meta-externalagent` | Addestramento | — | — |
| [meta-webindexer](https://dotsagent.io/it/agent-ready/bots/meta-webindexer)Meta | `meta-webindexer` | Ricerca | — | — |
| [meta-externalfetcher](https://dotsagent.io/it/agent-ready/bots/meta-externalfetcher)Meta | `meta-externalfetcher` | Richieste degli utenti | — | — |
| [meta-externalads](https://dotsagent.io/it/agent-ready/bots/meta-externalads)Meta | `meta-externalads` | Annunci | — | — |
| [facebookexternalhit](https://dotsagent.io/it/agent-ready/bots/facebookexternalhit)Meta | `facebookexternalhit` | Richieste degli utenti | — | — |
| [Muse](https://dotsagent.io/it/agent-ready/bots/muse)Meta | Nessun token | Agenti | — | — |
| [Amazonbot](https://dotsagent.io/it/agent-ready/bots/amazonbot)Amazon | `Amazonbot` | Addestramento | — | Elenco IP |
| [Amzn-SearchBot](https://dotsagent.io/it/agent-ready/bots/amzn-searchbot)Amazon | `Amzn-SearchBot` | Ricerca | — | Elenco IP |
| [Amzn-User](https://dotsagent.io/it/agent-ready/bots/amzn-user)Amazon | `Amzn-User` | Richieste degli utenti | — | Elenco IP |
| [DuckAssistBot](https://dotsagent.io/it/agent-ready/bots/duckassistbot)DuckDuckGo | `DuckAssistBot` | Ricerca | — | Elenco IP |
| [MistralAI-User](https://dotsagent.io/it/agent-ready/bots/mistralai-user)Mistral | `MistralAI-User` | Richieste degli utenti | — | Elenco IP |
| [MistralAI-Index](https://dotsagent.io/it/agent-ready/bots/mistralai-index)Mistral | `MistralAI-Index` | Ricerca | — | Elenco IP |
| [MistralAI-Training](https://dotsagent.io/it/agent-ready/bots/mistralai-training)Mistral | `MistralAI-Training` | Addestramento | — | — |
| [CCBot](https://dotsagent.io/it/agent-ready/bots/ccbot)Common Crawl | `CCBot` | Addestramento | — | Elenco IP |
| [cohere-ai](https://dotsagent.io/it/agent-ready/bots/cohere-ai)Cohere | `cohere-ai` | Richieste degli utenti | — | — |
| [Bytespider](https://dotsagent.io/it/agent-ready/bots/bytespider)ByteDance | `Bytespider` | Addestramento | — | — |
| [YouBot](https://dotsagent.io/it/agent-ready/bots/youbot)You.com | `YouBot` | Ricerca | — | — |
| [Diffbot](https://dotsagent.io/it/agent-ready/bots/diffbot)Diffbot | `Diffbot` | Ricerca | — | — |
| [Timpibot](https://dotsagent.io/it/agent-ready/bots/timpibot)Timpi | `Timpibot` | Addestramento | — | — |

## Significato delle finalità

- **Addestramento**: Raccoglie pagine per addestrare modelli o per attività di crawling di ricerca generale. Google-Extended e Applebot-Extended sono token di controllo che non recuperano direttamente alcun contenuto.
- **Ricerca**: Indicizza pagine per un prodotto di ricerca, da Google Search ai motori di risposta AI come ChatGPT search, Perplexity e DuckAssist. Se lo blocchi, il tuo sito non apparirà in quel prodotto.
- **Richieste degli utenti**: Recupera una pagina su richiesta di una persona, in una chat o tramite uno strumento. Diversi operatori dichiarano che robots.txt potrebbe non essere applicabile a queste richieste.
- **Agenti**: Naviga e agisce per conto dell'utente, spesso tramite un browser completo. Molti non hanno un token e possono essere identificati solo tramite firma, se possibile.
- **Annunci**: Verifica le pagine di destinazione degli annunci inviate dagli inserzionisti. Questi bot non sono inclusi nel generatore di robots.txt.

## Verifica che un bot sia davvero chi dice di essere

Una stringa user-agent si falsifica facilmente. La maggior parte dei grandi operatori pubblica gli intervalli IP usati dai propri bot in file JSON, indicati nella tabella come elenco IP. Confronta l'indirizzo della richiesta con l'elenco associato a quel token e considera non verificata una corrispondenza basata solo sul nome.

Alcuni operatori documentano anche il DNS inverso. Common Crawl, per esempio, dichiara che gli host di CCBot si risolvono in *.crawl.commoncrawl.org; prima di fidarti, verifica che il nome host si risolva di nuovo nello stesso indirizzo.

Gli agenti firmano sempre più spesso le richieste con HTTP Message Signatures (RFC 9421), secondo la bozza Web Bot Auth. La richiesta indica l'operatore in Signature-Agent e la verifica va eseguita con le chiavi pubbliche disponibili all'indirizzo /.well-known/http-message-signatures-directory del dominio. Una firma valida dimostra l'identità dell'operatore, non quella dell'utente né ciò che l'utente può fare.

[Crea un robots.txt da questo elenco →](https://dotsagent.io/it/agent-ready/robots-txt)

## Domande sui crawler IA

### Quali crawler IA ignorano robots.txt?

Secondo la documentazione dei rispettivi operatori, ChatGPT-User, Perplexity-User, Google-Agent, Google-GeminiNotebook, Amzn-User, meta-externalfetcher e facebookexternalhit potrebbero non rispettarlo, soprattutto perché il recupero è stato richiesto da un utente. Secondo la community, Bytespider non lo rispetta.

### Qual è la differenza tra GPTBot, OAI-SearchBot e ChatGPT-User?

GPTBot raccoglie pagine per addestrare i modelli OpenAI, OAI-SearchBot indicizza le pagine per la ricerca di ChatGPT e ChatGPT-User recupera una pagina su richiesta di una persona. I primi due rispettano robots.txt; OpenAI dichiara che le sue regole potrebbero non applicarsi al terzo.

### Quali agenti IA non hanno un token robots.txt?

ChatGPT agent, Gemini Spark e Muse di Meta. ChatGPT agent può essere verificato tramite la sua firma Web Bot Auth proveniente da https://chatgpt.com. In modalità locale di Chrome, Gemini Spark si presenta come il browser dell'utente; Muse non ha uno user-agent pubblicato.

### Come verifico che una richiesta provenga davvero da Googlebot?

Google pubblica gli intervalli IP di Googlebot in un file JSON, collegato dalla relativa voce in questa directory. Confronta l'indirizzo della richiesta con quegli intervalli, invece di fidarti della stringa user-agent.

### Da dove proviene questo elenco di bot IA?

Ogni voce rimanda alla documentazione dell'operatore, se disponibile; i token senza documentazione provengono dal registro community ai.robots.txt. Abbiamo escluso DeepSeekBot, Kimi-User, Manus-User, NovaAct, Devin e PetalBot perché non abbiamo trovato documentazione dei rispettivi operatori. L'elenco è stato verificato il 1 ottobre 2026.

Riferimento indipendente per chi sviluppa agenti IA. Non siamo affiliati a nessun fornitore citato qui.

© 2026 DotsAgent · Dati verificati il 1 ottobre 2026
