Dipende da cosa vendi e da come vuoi essere trovato, ma nella maggior parte dei casi conviene lasciare aperto l’accesso ai crawler AI. Bloccarli in modo indiscriminato ti toglie visibilità nei motori di risposta, senza darti in cambio un vantaggio reale.
Il robots.txt è un file di testo che dice ai crawler quali parti del sito possono leggere. I crawler AI, come GPTBot di OpenAI, lo rispettano quando lo trovano. Puoi quindi decidere tu, riga per riga, chi entra e chi resta fuori.
La domanda vera non è “aprire o chiudere”. È capire cosa perdi bloccando e cosa proteggi davvero. Chi vive di contenuti e reputazione ha interessi diversi da chi teme che i propri testi finiscano in un dataset di addestramento. Sotto trovi come ragionare in modo concreto.
Cosa fa davvero un crawler AI sul tuo sito
Un crawler AI è un programma che scarica le pagine del tuo sito per usarle a due scopi distinti. Il primo è l’addestramento: i testi entrano nei dati con cui il modello impara. Il secondo è il retrieval: il modello legge le tue pagine in tempo reale per rispondere a una domanda dell’utente, citandoti.
Questa distinzione conta. Se blocchi tutto, escludi i tuoi contenuti anche dalle risposte in tempo reale, quelle in cui ChatGPT o Perplexity potrebbero linkare il tuo sito come fonte. In pratica rinunci a comparire proprio dove le persone cercano risposte, non solo pagine.
Perché nella maggior parte dei casi conviene lasciare aperto
Perché la visibilità nei motori di risposta AI vale più della protezione teorica dei tuoi testi. Chi cerca informazioni oggi passa sempre più spesso da ChatGPT, Perplexity e Google AI, non solo dai risultati classici. Se non ti leggono, non ti citano.
Prima di decidere, valuta questi punti concreti.
Cosa considerare prima di bloccare o aprire:
- Il tuo modello di business. Se attrai clienti con contenuti utili, essere citato dall’AI ti porta traffico e autorevolezza.
- Il tipo di contenuti. Testi pubblici e informativi hanno poco da proteggere; documentazione riservata va comunque messa dietro autenticazione, non affidata al robots.txt.
- La differenza tra bot. Puoi bloccare i crawler di addestramento e lasciare passare quelli di retrieval, con regole separate.
- Il valore SEO. Web Marketing e SEO e citabilità AI oggi si muovono insieme: chiudere una porta spesso ne chiude due.
- Il falso senso di sicurezza. Il robots.txt è una richiesta, non un muro: crawler non conformi possono ignorarlo del tutto.
La conclusione operativa è semplice. Se il tuo sito serve a farti trovare e a costruire fiducia, tenere aperto conviene. Il blocco totale ha senso solo in casi specifici, che vediamo ora.
Quando ha senso bloccare i crawler AI?
Ha senso bloccare quando i tuoi contenuti hanno valore commerciale diretto e non vuoi che finiscano gratis in un modello. Editori, banche dati a pagamento, archivi proprietari: qui la scelta di chiudere l’addestramento è legittima e spesso corretta.
Ha senso anche quando pubblichi materiale che non vuoi veder rielaborato senza controllo, come report a pagamento o corsi. In questi casi però il robots.txt non basta: i contenuti sensibili vanno protetti con login e paywall, perché un file di testo non impedisce a nessuno di leggerli davvero.
Per un’azienda B2B che usa il sito come vetrina e canale di acquisizione, questi casi sono rari. Il rischio più concreto non è “farsi rubare i testi”, ma scomparire dalle risposte AI mentre i concorrenti restano visibili e citati.
Come si configura il blocco in modo selettivo?
Si configura aggiungendo regole specifiche nel robots.txt, una per ciascun crawler che vuoi gestire. Ogni motore AI usa un user-agent diverso, cioè un nome identificativo: GPTBot per OpenAI, ClaudeBot per Anthropic, PerplexityBot per Perplexity. Puoi trattarli uno a uno.
L’approcio più equilibrato è selettivo. Blocchi solo i bot di addestramento che ti preoccupano, lasci passare quelli di retrieval e i motori di ricerca tradizionali. Così proteggi ciò che vuoi proteggere senza sacrificare la visibilità nelle risposte in tempo reale.
Una regola vale sempre. Prima di modificare il robots.txt, verifica che non stia già bloccando per errore pagine importanti per la SEO. Un file scritto male può escludere sezioni intere del sito dai motori, con danni ben più gravi di qualsiasi crawler AI.
Le domande che mi arrivano più spesso su robots.txt e AI
Se blocco GPTBot, ChatGPT smette di citarmi?
In parte sì. Bloccando GPTBot impedisci a OpenAI di leggere le tue pagine, sia per l’addestramento sia, in molti casi, per il retrieval. Questo riduce la probabilità che ChatGPT ti citi come fonte quando risponde agli utenti. Se il tuo obiettivo è comparire in quelle risposte, il blocco lavora contro di te.
Il robots.txt protegge davvero i miei contenuti?
No, non li protegge in senso stretto. Il robots.txt è una richiesta di comportamento, non un blocco tecnico: i crawler conformi la rispettano, quelli non conformi possono ignorarla. Per proteggere davvero un contenuto servono autenticazione, paywall o restrizioni a livello di server. Il file di testo scoraggia i bot corretti, nulla di più.
Posso lasciare passare Google e bloccare solo l’AI?
Sì, con regole separate. Il crawler di Google per la ricerca classica ha un user-agent distinto da quelli AI. Puoi consentire Googlebot e bloccare GPTBot o ClaudeBot nello stesso file. Attento però: Google usa i contenuti anche per le sue risposte AI, quindi la separazione non è sempre netta come sembra.
Cambiare il robots.txt ha effetti immediati?
No, gli effetti richiedono tempo. I crawler rileggono il robots.txt periodicamente, non a ogni visita, quindi una modifica può impiegare giorni prima di essere recepita da tutti. I contenuti già acquisiti, inoltre, restano nei sistemi finché non vengono aggiornati. Il blocco agisce sul futuro, non cancella il passato.
Come decido cosa fare per la mia azienda?
Parti dall’obiettivo del sito. Se serve a farti trovare e generare contatti, apri l’accesso e lavora sulla citabilità. Se ospita contenuti a valore commerciale diretto, blocca l’addestramento ma proteggi il resto con strumenti veri. Una Consulenza AI o un AI Assessment ti aiutano a mappare i contenuti e a scrivere regole coerenti con la tua strategia.
Vuoi capire quale configurazione ha senso per il tuo sito?
Ogni sito ha una funzione diversa. Prima di toccare il robots.txt, serve capire cosa vuoi ottenere: più visibilità nelle risposte AI, più protezione dei contenuti, o un equilibrio tra i due.
Nel tuo caso specifico la risposta dipende dal modello di business, dal tipo di contenuti che pubblichi e da come i tuoi clienti ti cercano. Un primo confronto serve proprio a questo: capire se conviene aprire, chiudere o gestire in modo selettivo, senza scelte a caso.
Se vuoi ragionarci insieme, scrivimi dalla pagina contatti e definiamo la configurazione più adatta al tuo sito.



