Veja se o seu site bloqueia os robôs de IA.
Uma linha no robots.txt decide se o ChatGPT, o Claude e a Perplexity podem ler o seu site, e citar a sua marca. Digite o domínio e veja os 10 agentes que importam, um a um.
- Módulo
- AEO/GEO
- Entrada
- Um domínio
- Onde roda
- Servidor Rovemark
- Custo
- Grátis, sem cadastro
O arquivo que decide se a IA pode citar você
O robots.txt fica na raiz do domínio e é a primeira coisa que qualquer rastreador pede antes de abrir uma página. Nele o site declara quem entra e quem não entra. Até 2023 essa lista tinha um público só: buscadores. Hoje ela tem dois, e a maioria dos sites nunca separou um do outro.
A ferramenta busca o seu robots.txt, aplica as regras do protocolo, grupo com nome do agente vence o curinga, Allow vence Disallow no mesmo caminho, e devolve o veredito para os 10 agentes de IA que mais circulam hoje, separados pelo que cada um faz.
- 01
Você entra com o domínio
Só o domínio, sem cadastro. A ferramenta busca o robots.txt direto da origem, como um rastreador faria.
- 02
As regras são aplicadas por agente
Não é busca de texto: o arquivo é interpretado como o protocolo manda, respeitando a precedência entre grupo específico e curinga.
- 03
O veredito sai separado por papel
Bots de busca e de treino aparecem em blocos distintos, porque bloquear um é decisão de marketing e bloquear o outro é decisão de propriedade intelectual.
- 01
O que é o robots.txt e por que ele importa para a IA?
- É um arquivo de texto na raiz do site que declara quais robôs podem acessar quais caminhos. Assistentes de IA respeitam esse arquivo: se o seu domínio barra o OAI-SearchBot, o ChatGPT não consegue abrir a sua página para citá-la numa resposta, mesmo que ela seja a melhor fonte que existe sobre o assunto.
- 02
Qual a diferença entre robô de busca e robô de treino?
- O de busca (OAI-SearchBot, PerplexityBot, Claude-SearchBot) lê a sua página no momento em que alguém pergunta, para montar a resposta e creditar a fonte com um link. O de treino (GPTBot, Google-Extended, CCBot) coleta conteúdo para treinar modelos futuros, sem link de volta. Bloquear o de treino protege o seu conteúdo; bloquear o de busca tira você da resposta.
- 03
Bloquear o GPTBot tira a minha marca do ChatGPT?
- Não diretamente. O GPTBot é o coletor de treino da OpenAI. Quem busca em tempo real e cita a fonte é o OAI-SearchBot e o ChatGPT-User. Dá para bloquear o treino e continuar sendo citado, vários veículos de notícia fazem exatamente isso.
- 04
Meu site não tem robots.txt. Isso é ruim?
- Pelo protocolo, a ausência do arquivo significa que tudo é permitido, então nenhum robô de IA está barrado. Não é um problema de visibilidade. É um problema se você achava que tinha controle e não tinha.
- 05
Meu site bloqueia tudo. Como libero só os robôs certos?
- Declare um grupo com o nome de cada agente que você quer liberar. A regra do protocolo é que o grupo nomeado vence o User-agent curinga, esteja ele antes ou depois. Um grupo com Disallow vazio libera o agente inteiro.
- 06
Com que frequência devo checar isso?
- Sempre que trocar de CMS, de CDN ou de plataforma de e-commerce, muitas geram o robots.txt sozinhas e sobrescrevem o seu. Também vale checar quando um agente novo entra em circulação: a lista de robôs de IA mudou várias vezes desde 2023.
O robots.txt é a porta. E depois dela?
Deixar a IA entrar é o mínimo. Saber o que ela responde quando perguntam da sua marca, e mudar essa resposta, é o que a plataforma faz.
