Ferramentas

Veja se o seu site bloqueia os robôs de IA.

Uma linha no robots.txt decide se o ChatGPT, o Claude e a Perplexity podem ler o seu site, e citar a sua marca. Digite o domínio e veja os 10 agentes que importam, um a um.

Módulo
AEO/GEO
Entrada
Um domínio
Onde roda
Servidor Rovemark
Custo
Grátis, sem cadastro
O que a ferramenta lê

O arquivo que decide se a IA pode citar você

O robots.txt fica na raiz do domínio e é a primeira coisa que qualquer rastreador pede antes de abrir uma página. Nele o site declara quem entra e quem não entra. Até 2023 essa lista tinha um público só: buscadores. Hoje ela tem dois, e a maioria dos sites nunca separou um do outro.

A ferramenta busca o seu robots.txt, aplica as regras do protocolo, grupo com nome do agente vence o curinga, Allow vence Disallow no mesmo caminho, e devolve o veredito para os 10 agentes de IA que mais circulam hoje, separados pelo que cada um faz.

Como funciona
  1. 01

    Você entra com o domínio

    Só o domínio, sem cadastro. A ferramenta busca o robots.txt direto da origem, como um rastreador faria.

  2. 02

    As regras são aplicadas por agente

    Não é busca de texto: o arquivo é interpretado como o protocolo manda, respeitando a precedência entre grupo específico e curinga.

  3. 03

    O veredito sai separado por papel

    Bots de busca e de treino aparecem em blocos distintos, porque bloquear um é decisão de marketing e bloquear o outro é decisão de propriedade intelectual.

Perguntas frequentes
01

O que é o robots.txt e por que ele importa para a IA?

É um arquivo de texto na raiz do site que declara quais robôs podem acessar quais caminhos. Assistentes de IA respeitam esse arquivo: se o seu domínio barra o OAI-SearchBot, o ChatGPT não consegue abrir a sua página para citá-la numa resposta, mesmo que ela seja a melhor fonte que existe sobre o assunto.
02

Qual a diferença entre robô de busca e robô de treino?

O de busca (OAI-SearchBot, PerplexityBot, Claude-SearchBot) lê a sua página no momento em que alguém pergunta, para montar a resposta e creditar a fonte com um link. O de treino (GPTBot, Google-Extended, CCBot) coleta conteúdo para treinar modelos futuros, sem link de volta. Bloquear o de treino protege o seu conteúdo; bloquear o de busca tira você da resposta.
03

Bloquear o GPTBot tira a minha marca do ChatGPT?

Não diretamente. O GPTBot é o coletor de treino da OpenAI. Quem busca em tempo real e cita a fonte é o OAI-SearchBot e o ChatGPT-User. Dá para bloquear o treino e continuar sendo citado, vários veículos de notícia fazem exatamente isso.
04

Meu site não tem robots.txt. Isso é ruim?

Pelo protocolo, a ausência do arquivo significa que tudo é permitido, então nenhum robô de IA está barrado. Não é um problema de visibilidade. É um problema se você achava que tinha controle e não tinha.
05

Meu site bloqueia tudo. Como libero só os robôs certos?

Declare um grupo com o nome de cada agente que você quer liberar. A regra do protocolo é que o grupo nomeado vence o User-agent curinga, esteja ele antes ou depois. Um grupo com Disallow vazio libera o agente inteiro.
06

Com que frequência devo checar isso?

Sempre que trocar de CMS, de CDN ou de plataforma de e-commerce, muitas geram o robots.txt sozinhas e sobrescrevem o seu. Também vale checar quando um agente novo entra em circulação: a lista de robôs de IA mudou várias vezes desde 2023.

O robots.txt é a porta. E depois dela?

Deixar a IA entrar é o mínimo. Saber o que ela responde quando perguntam da sua marca, e mudar essa resposta, é o que a plataforma faz.