// guida
Come configurare robots.txt per i crawler IA?
Aggiornato: 2026-08-19
// risposta breve
Configurare robots.txt per i crawler IA significa prendere tre decisioni separate, non una: se ammettere i crawler di addestramento, i crawler dell'indice di ricerca e i fetcher avviati dall'utente. Ogni vendor usa user-agent diversi per ciascun compito. La maggior parte dei siti dovrebbe consentire la ricerca e i recuperi dell'utente, decidere deliberatamente sull'addestramento — e sapere che alcuni fetcher ignorano del tutto robots.txt.
Una decisione che in realtà è tre
«Dovrei bloccare i bot IA?» non ha risposta, perché non è una sola domanda. Ogni grande azienda di IA gestisce crawler separati per compiti separati: i crawler di addestramento alimentano i corpora dei modelli, i crawler dell'indice di ricerca alimentano le risposte che vi citano, e i fetcher avviati dall'utente leggono una pagina perché una persona ha appena interrogato l'assistente su quella pagina. Bloccateli tutti con una sola riga e non avrete preso posizione sull'addestramento dell'IA — vi sarete tolti dalle risposte dell'IA.
I costi sono asimmetrici. Bloccare un crawler di addestramento è una scelta filosofica che, nella maggior parte dei casi, non ha un prezzo in visibilità: Google e Apple lo documentano esplicitamente, e per OpenAI e Anthropic discende dalla separazione dei bot — la ricerca gira su agenti separati, con conseguenze documentate separatamente. Bloccare un agente di ricerca o di recupero utente ha un prezzo diretto e documentato — OpenAI, per esempio, dichiara che i siti che hanno escluso OAI-SearchBot «non verranno mostrati nelle risposte della ricerca di ChatGPT». La meccanica dei singoli motori è trattata nelle nostre guide su come farsi citare da ChatGPT, Claude e Perplexity; questa pagina è la mappa completa.
Due numeri inquadrano lo scambio. Cloudflare ha misurato quante pagine le aziende di IA scansionano per ogni visita che rimandano indietro: secondo i dati di Cloudflare Radar per giugno 2025, circa 1.700 scansioni per referral per OpenAI e circa 70.900 per Anthropic. I rapporti da allora stanno calando — la dashboard AI Insights di Cloudflare li segue in tempo reale — ma la forma dell'accordo è chiara: scambiate una scansione intensiva con le citazioni. La tabella qui sotto è il modo per fissarne i termini.
La lista completa dei crawler IA, verificata sulla documentazione dei vendor
Ogni riga qui sotto è verificata sulla documentazione dell'operatore stesso, aggiornata ad agosto 2026. «Token» significa che il nome funziona solo come gruppo robots.txt — non esiste un crawler separato con quello user-agent.
| User-agent | Compito | Rispetta robots.txt | Cosa vi costa il blocco |
|---|---|---|---|
| GPTBot — OpenAI | Addestramento | Sì | Contenuti futuri esclusi dall'addestramento dei modelli OpenAI; la ricerca di ChatGPT gira su OAI-SearchBot |
| OAI-SearchBot — OpenAI | Indice di ricerca | Sì | «Non verranno mostrati nelle risposte della ricerca di ChatGPT» |
| ChatGPT-User — OpenAI | Recupero utente | «Le regole potrebbero non applicarsi» (ufficiale) | Solo dichiarativo — i recuperi sono avviati dall'utente |
| ClaudeBot — Anthropic | Addestramento | Sì | Contenuti futuri esclusi dai dataset di addestramento di Anthropic |
| Claude-SearchBot — Anthropic | Indice di ricerca | Sì | Non indicizzato — «potrebbe ridurre la visibilità del sito» |
| Claude-User — Anthropic | Recupero utente | Sì | La pagina non può essere recuperata su richiesta di un utente Claude |
| PerplexityBot — Perplexity | Indice di ricerca | Sì | Fuori dall'indice di ricerca e dalle citazioni di Perplexity |
| Perplexity-User — Perplexity | Recupero utente | «In genere ignora robots.txt» (ufficiale) | Solo dichiarativo |
| Google-Extended — Google (token) | Controllo di addestramento e grounding | Rispettato tramite Googlebot | Fuori dall'addestramento e dal grounding di Gemini; Search e AI Overviews non toccati |
| Applebot — Apple | Indice di ricerca (Siri, Spotlight, Safari) | Sì — segue le regole di Googlebot se non nominato | Fuori dalle superfici di ricerca Apple |
| Applebot-Extended — Apple (token) | Controllo di addestramento | Rispettato tramite Applebot | Fuori dall'addestramento dei foundation model di Apple; resta in Siri e Spotlight |
| Meta-ExternalAgent — Meta | Addestramento + indicizzazione | Sì | Fuori dall'addestramento di Meta AI e dal suo indice |
| Meta-ExternalFetcher — Meta | Recupero utente | «Può aggirare robots.txt» (ufficiale) | Solo dichiarativo |
| CCBot — Common Crawl | Archivio del web aperto | Sì | Fuori dai dataset pubblici su cui si addestrano molti laboratori di IA — un'esclusione all'ingrosso |
| Amazonbot — Amazon | Miglioramento dei prodotti; può addestrare i modelli IA di Amazon | Sì | Fuori dalla scansione di Amazon, incluso qualsiasi addestramento di modelli |
| Amzn-SearchBot — Amazon | Indice di ricerca (esperienze di ricerca Alexa; nessun addestramento) | Sì — segue le regole generiche dei bot di ricerca se non nominato | Fuori dalle esperienze di ricerca Alexa |
| Amzn-User — Amazon | Recupero utente (richieste Alexa) | «Potrebbe non seguire tutte le direttive di robots.txt» (ufficiale) | Solo dichiarativo |
| DuckAssistBot — DuckDuckGo | Risposte in tempo reale (nessun addestramento) | Sì (applicato entro 72 ore) | Fuori dalle risposte DuckAssist |
| Bytespider — ByteDance | Addestramento (non documentato) | No — lo ignora nella pratica misurata | Nulla via robots.txt; serve un blocco a livello di server |
Come bloccare i crawler IA — o no: tre configurazioni pronte all'uso
La tabella si traduce in tre politiche praticabili.
Config 1 — visibilità prima di tutto. Consentire tutto, esplicitamente: un gruppo Allow per agente per ogni bot documentato della tabella (tutti tranne Bytespider — un Allow per un bot che ignora il file è solo rumore), più un catch-all. Adatta ai siti che vivono dell'essere trovati e citati — aziende di contenuti, agenzie, gran parte del B2B. È quella che usiamo noi stessi; vedi «Come gestiamo il nostro» più avanti.
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /…e così via per ciascun agente della tabella. Il nostro file di produzione su get-geo.ai/robots.txt è la versione completa.
Config 2 — niente addestramento. La scelta deliberata più comune: restare fuori dai corpora dei modelli, restare nelle risposte. Vietate i crawler e i token di addestramento, consentite il resto. Due avvertenze prima di incollare: la riga Bytespider è dichiarativa (la sezione successiva spiega perché), e togliere Meta-ExternalAgent è l'unica esclusione dall'addestramento con un prezzo in visibilità — esce anche dall'indice di Meta:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: *
Allow: /Config 3 — chiusura totale. Legittima per contenuti a pagamento o proprietari. Robots.txt consente a più righe User-agent di condividere un unico blocco di regole, quindi il tutto resta compatto — qui lasciamo fuori Applebot perché bloccarlo vi rimuove anche dalla ricerca di Siri e Spotlight, una decisione più grande delle risposte dell'IA:
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: Meta-ExternalFetcher
User-agent: CCBot
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: Bytespider
Disallow: /Leggete la sezione successiva prima di mettere in produzione questa configurazione: per diversi degli agenti qui sopra, il file è una richiesta, non una barriera.
Quali crawler IA ignorano robots.txt
Robots.txt è una politica pubblicata, non un meccanismo di applicazione — e per un'intera classe di agenti lo dicono i vendor stessi. OpenAI su ChatGPT-User: «Poiché queste azioni sono avviate da un utente, le regole di robots.txt potrebbero non applicarsi». Meta su Meta-ExternalFetcher: «può aggirare robots.txt perché esegue recuperi richiesti dall'utente». Il fetcher utente di Perplexity «in genere ignora le regole di robots.txt». Amazon su Amzn-User: «potrebbe non seguire tutte le direttive di robots.txt». La logica è coerente: lo ha chiesto un umano, quindi il recupero è trattato come la visita dell'umano, non come una scansione.
Poi c'è Bytespider, che non ha alcuna documentazione e ignora il file nella pratica misurata: Cloudflare lo ha visto colpire più siti protetti di qualsiasi altro crawler IA (40,4% a metà 2024), e HAProxy lo ha misurato vicino al 90% del proprio traffico da crawler IA, notando che ignora le istruzioni di robots.txt.
L'applicazione delle regole vive quindi un livello più in basso. Verificate i crawler sugli elenchi di IP che la maggior parte dei vendor pubblica — OpenAI, Anthropic, Apple, Common Crawl e DuckDuckGo mantengono elenchi JSON, Amazon pubblica i propri range sulla pagina per sviluppatori — e bloccate a livello di CDN o WAF ciò che volete davvero fermare. La verifica conta più di quanto sembri: HUMAN Security ha misurato che una richiesta su diciotto con lo user-agent di un crawler IA noto è contraffatta.
Come gestiamo il nostro
Il nostro robots.txt è la configurazione visibilità prima di tutto: diciannove gruppi Allow espliciti per agente — ogni agente della tabella che rispetta il file, i fetcher utente che comunque accogliamo, e il classico Bingbot — seguiti da un Allow catch-all. Lo abbiamo riscritto in questa forma ad agosto 2026, eliminando nello stesso passaggio il vecchio gruppo anthropic-ai — e, durante il fact-checking di questa guida, anche uno speculativo gruppo cohere-ai: la documentazione di Cohere stessa dichiara che al momento non gestisce alcun crawler.
L'obiezione ovvia: un «User-agent: * / Allow: /» di una sola riga produrrebbe un comportamento identico dei crawler. Vero. I gruppi espliciti comprano tre cose che la riga unica non dà. Ogni vendor riceve un segnale di intento non ambiguo invece di un'assenza di obiezione. Le modifiche future sono più sicure — un Disallow aggiunto per un agente non può applicarsi in silenzio ad agenti a cui nessuno ha pensato. E il file fa anche da checklist di revisione: quando un vendor lancia un nuovo agente, come hanno fatto sia OpenAI sia Anthropic negli ultimi due anni, la lacuna è visibile nel file stesso e nei nostri log di scansione.
Il file è un pezzo dell'assetto che documentiamo nella nostra guida su come facciamo GEO sul nostro sito. È la politica di un sito che vive di citazioni dell'IA. Un editore con archivi a pagamento sceglierebbe ragionevolmente la config 2 o 3 — il punto di questa guida non è la nostra risposta, ma la tabella che vi permette di scegliere la vostra. Qualunque configurazione scegliate, mettete in calendario una revisione trimestrale: l'elenco continua a muoversi — OpenAI ha aggiunto OAI-SearchBot nel 2024, Anthropic ha aggiunto Claude-SearchBot nel 2025, Amazon ha diviso la sua scansione in tre agenti entro il 2026 — e un robots.txt scritto nel 2024 è già sbagliato sui crawler di oggi.
Domande correlate
Dovrei bloccare i crawler IA?
Dividete la domanda per compito. Bloccare i crawler di addestramento (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, Amazonbot) non costa visibilità di ricerca — documentato esplicitamente da Google e Apple, strutturale per gli altri. L'eccezione è Meta-ExternalAgent, che addestra e indicizza con un solo agente: bloccarlo vi fa uscire da entrambi. Bloccare gli agenti dell'indice di ricerca e di recupero utente vi rimuove dalle risposte dell'IA, dove viene posta una quota crescente delle domande d'acquisto. Decidete la questione dell'addestramento per principio; decidete la questione della visibilità in base a da dove arrivano le vostre citazioni e il vostro traffico.
Bloccare GPTBot rimuove il mio sito da ChatGPT?
No. GPTBot alimenta solo l'addestramento dei modelli. La ricerca di ChatGPT gira su OAI-SearchBot, e le letture di pagina richieste dall'utente passano da ChatGPT-User — bloccate GPTBot ed entrambi continuano a funzionare. È la stessa separazione che Anthropic applica con ClaudeBot rispetto a Claude-SearchBot e Claude-User.
Google-Extended influisce sulle AI Overviews?
No — ed è l'errore più comune del genere. Google documenta che Google-Extended controlla l'addestramento e il grounding di Gemini e «non influisce sull'inclusione di un sito nella Ricerca Google». Le AI Overviews e l'AI Mode fanno parte della Ricerca stessa: sono governate dall'accesso di Googlebot e dai controlli sugli snippet — nosnippet, data-nosnippet, max-snippet, noindex. La meccanica completa è nella nostra guida su come comparire nelle AI Overviews di Google.
Come verifico che un crawler sia autentico?
Non fidatevi mai della sola stringa user-agent — una richiesta su diciotto che dichiara di essere un crawler IA noto è contraffatta, secondo le misurazioni 2026 di HUMAN Security. Confrontate l'IP di origine con l'elenco pubblicato dal vendor: OpenAI, Anthropic, Apple, Common Crawl e DuckDuckGo pubblicano elenchi di IP in JSON, Amazon pubblica i propri range sulla pagina per sviluppatori, e Google e Apple supportano la verifica tramite reverse DNS. Tutto ciò che fallisce il controllo va trattato come uno scraper, comunque si presenti.
Robots.txt basta, o serve anche llms.txt?
Fanno lavori diversi. Robots.txt controlla l'accesso — chi può recuperare cosa. llms.txt è un aiuto alla navigazione — una mappa leggibile dalle macchine che aiuta i modelli a trovare e interpretare le vostre pagine chiave una volta dentro. Prima l'accesso: un llms.txt dietro un Disallow generale non aiuta nessuno. llms.txt ha una guida dedicata in questa serie.
Guide correlate
Fonti
- 01La nostra guida: Come comparire nelle AI Overviews di Google?
- 02La nostra guida: Come fare GEO sul proprio sito in pratica?
- 03OpenAI — documentazione dei bot: GPTBot, OAI-SearchBot, ChatGPT-User
- 04Anthropic — documentazione dei crawler: ClaudeBot, Claude-SearchBot, Claude-User
- 05Perplexity — documentazione dei crawler: PerplexityBot, Perplexity-User
- 06Google — crawler comuni e Google-Extended
- 07Google — funzionalità IA nella Ricerca e controlli per i proprietari di siti
- 08Apple — Applebot e Applebot-Extended
- 09Meta — web crawler: Meta-ExternalAgent, Meta-ExternalFetcher
- 10Common Crawl — documentazione di CCBot
- 11Amazon — documentazione di Amazonbot
- 12DuckDuckGo — documentazione di DuckAssistBot
- 13Cloudflare — il rapporto scansioni/referral delle piattaforme IA (luglio 2025) e AI Insights in tempo reale
- 14Cloudflare — Bytespider in testa al traffico e ai blocchi dei bot IA (luglio 2024)
- 15HAProxy — ~90% del nostro traffico da crawler IA è Bytespider (ott. 2024)
- 16HUMAN Security — State of AI traffic 2026: benchmark sullo spoofing dei crawler
// condividi