Strumenti

Scopri se il tuo sito blocca i crawler di IA.

Una riga nel robots.txt decide se ChatGPT, Claude e Perplexity possono leggere il tuo sito e citare il tuo marchio. Inserisci il dominio e scopri i 10 agenti che contano, uno per uno.

Modulo
AEO/GEO
Ingresso
Un dominio
Dove gira
Server Rovemark
Costo
Gratis, senza registrazione
Cosa legge lo strumento

Il file che decide se l’IA può citarti

Il robots.txt si trova nella radice del dominio ed è la prima cosa che ogni crawler richiede prima di aprire una pagina. Lì il sito dichiara chi entra e chi non entra. Fino al 2023 questo elenco aveva un solo pubblico: i motori di ricerca. Oggi ne ha due, e la maggior parte dei siti non li ha mai separati.

Lo strumento recupera il tuo robots.txt, applica le regole del protocollo, il gruppo con il nome dell'agente prevale sul jolly, Allow prevale su Disallow nello stesso percorso, e restituisce il verdetto per i 10 agenti di IA più diffusi oggi, separati in base a ciò che fa ciascuno.

Come funziona
  1. 01

    Inserisci il dominio

    Solo il dominio, senza registrazione. Lo strumento recupera il robots.txt direttamente dall’origine, come farebbe un crawler.

  2. 02

    Le regole si applicano per agente

    Non è una ricerca testuale: il file viene interpretato come impone il protocollo, rispettando la precedenza tra gruppo specifico e jolly.

  3. 03

    Il verdetto esce diviso per ruolo

    I crawler di ricerca e quelli di addestramento compaiono in blocchi distinti, perché bloccare gli uni è una decisione di marketing e bloccare gli altri una decisione di proprietà intellettuale.

Domande frequenti
01

Cos’è il robots.txt e perché conta per l’IA?

È un file di testo nella radice del sito che dichiara quali robot possono accedere a quali percorsi. Gli assistenti IA rispettano questo file: se il tuo dominio blocca OAI-SearchBot, ChatGPT non riesce ad aprire la tua pagina per citarla in una risposta, anche se è la migliore fonte esistente sull'argomento.
02

Che differenza c’è tra crawler di ricerca e di addestramento?

Quello di ricerca (OAI-SearchBot, PerplexityBot, Claude-SearchBot) legge la tua pagina nel momento in cui qualcuno chiede, per comporre la risposta e accreditare la fonte con un link. Quello di addestramento (GPTBot, Google-Extended, CCBot) raccoglie contenuti per addestrare modelli futuri, senza link di ritorno. Bloccare quello di addestramento protegge i tuoi contenuti; bloccare quello di ricerca ti toglie dalla risposta.
03

Bloccare GPTBot toglie il mio marchio da ChatGPT?

Non direttamente. GPTBot è il crawler per l'addestramento di OpenAI. A cercare in tempo reale e citare la fonte sono OAI-SearchBot e ChatGPT-User. Puoi bloccare l'addestramento e continuare a essere citato, diverse testate giornalistiche fanno esattamente questo.
04

Il mio sito non ha robots.txt. È un male?

Secondo il protocollo, l'assenza del file significa che tutto è consentito, quindi nessun robot di IA è bloccato. Non è un problema di visibilità. È un problema se pensavi di avere il controllo e non lo avevi.
05

Il mio sito blocca tutto. Come permetto solo i crawler giusti?

Dichiara un gruppo col nome di ogni agente che vuoi permettere. La regola del protocollo è che il gruppo nominato batte lo User-agent jolly, che venga prima o dopo. Un gruppo con Disallow vuoto permette l’agente per intero.
06

Ogni quanto devo controllare?

Ogni volta che cambi CMS, CDN o piattaforma e-commerce, molte generano robots.txt automaticamente e sovrascrivono il tuo. Vale anche la pena controllare quando entra in circolazione un nuovo agente: l'elenco dei robot di IA è cambiato più volte dal 2023.

Il robots.txt è la porta. E dopo?

Lasciare entrare l'IA è il minimo. Sapere cosa risponde quando le chiedono del tuo marchio, e cambiare quella risposta, è ciò che fa la piattaforma.