Herramientas

Ve si tu sitio bloquea a los rastreadores de IA.

Una línea en el robots.txt decide si ChatGPT, Claude y Perplexity pueden leer tu sitio y citar tu marca. Escribe el dominio y ve los 10 agentes que importan, uno por uno.

Módulo
AEO/GEO
Entrada
Un dominio
Dónde funciona
Servidor Rovemark
Coste
Gratis, sin registro
Qué lee la herramienta

El archivo que decide si la IA puede citarte

El robots.txt está en la raíz del dominio y es lo primero que cualquier rastreador solicita antes de abrir una página. Allí el sitio declara quién entra y quién no. Hasta 2023 esta lista tenía un solo público: los buscadores. Hoy tiene dos, y la mayoría de los sitios nunca separó uno del otro.

La herramienta busca tu robots.txt, aplica las reglas del protocolo, el grupo con nombre de agente gana al comodín, Allow gana a Disallow en la misma ruta, y devuelve el veredicto para los 10 agentes de IA que más circulan hoy, separados por lo que hace cada uno.

Cómo funciona
  1. 01

    Escribes el dominio

    Solo el dominio, sin registro. La herramienta busca robots.txt directamente en el origen, como haría un rastreador.

  2. 02

    Las reglas se aplican por agente

    No es una búsqueda de texto: el archivo se interpreta como manda el protocolo, respetando la precedencia entre grupo específico y comodín.

  3. 03

    El veredicto sale separado por función

    Los rastreadores de búsqueda y los de entrenamiento aparecen en bloques distintos, porque bloquear uno es una decisión de marketing y bloquear el otro es una decisión de propiedad intelectual.

Preguntas frecuentes
01

¿Qué es robots.txt y por qué importa para la IA?

Es un archivo de texto en la raíz del sitio que declara qué robots pueden acceder a qué rutas. Los asistentes de IA respetan este archivo: si tu dominio bloquea OAI-SearchBot, ChatGPT no puede abrir tu página para citarla en una respuesta, incluso si es la mejor fuente que existe sobre el tema.
02

¿Qué diferencia hay entre rastreador de búsqueda y de entrenamiento?

El de búsqueda (OAI-SearchBot, PerplexityBot, Claude-SearchBot) lee tu página en el momento en que alguien pregunta, para montar la respuesta y acreditar la fuente con un enlace. El de entrenamiento (GPTBot, Google-Extended, CCBot) recoge contenido para entrenar modelos futuros, sin enlace de vuelta. Bloquear el de entrenamiento protege tu contenido; bloquear el de búsqueda te saca de la respuesta.
03

¿Bloquear GPTBot saca mi marca de ChatGPT?

No directamente. GPTBot es el recopilador de entrenamiento de OpenAI. Quienes buscan en tiempo real y citan la fuente son OAI-SearchBot y ChatGPT-User. Puedes bloquear el entrenamiento y seguir siendo citado, varios medios de noticias hacen exactamente eso.
04

Mi sitio no tiene robots.txt. ¿Eso es malo?

Según el protocolo, la ausencia del archivo significa que todo está permitido, por lo tanto ningún robot de IA está bloqueado. No es un problema de visibilidad. Es un problema si creías que tenías control y no lo tenías.
05

Mi sitio lo bloquea todo. ¿Cómo permito solo a los rastreadores correctos?

Declara un grupo con el nombre de cada agente que quieras permitir. La regla del protocolo es que el grupo nombrado gana al User-agent comodín, esté antes o después. Un grupo con Disallow vacío permite al agente por completo.
06

¿Cada cuánto debo comprobarlo?

Cada vez que cambies de CMS, CDN o plataforma de e-commerce, muchas generan el robots.txt por sí solas y sobrescriben el tuyo. También conviene revisarlo cuando un agente nuevo entra en circulación: la lista de robots de IA ha cambiado varias veces desde 2023.

robots.txt es la puerta. ¿Y después de ella?

Dejar que la IA entre es lo mínimo. Saber qué responde cuando preguntan por tu marca, y cambiar esa respuesta, es lo que hace la plataforma.