Outils

Voyez si votre site bloque les robots d’IA.

Une ligne dans le robots.txt décide si ChatGPT, Claude et Perplexity peuvent lire votre site et citer votre marque. Saisissez le domaine et voyez les 10 agents qui comptent, un par un.

Module
AEO/GEO
Entrée
Un domaine
Où ça tourne
Serveur Rovemark
Coût
Gratuit, sans inscription
Ce que l’outil lit

Le fichier qui décide si l’IA peut vous citer

Le robots.txt se trouve à la racine du domaine et c’est la première chose que tout robot d’indexation demande avant d’ouvrir une page. Le site y déclare qui entre et qui n’entre pas. Jusqu’en 2023, cette liste n’avait qu’un seul public : les moteurs de recherche. Aujourd’hui, elle en a deux, et la plupart des sites ne les ont jamais séparés.

L’outil récupère votre robots.txt, applique les règles du protocole, le groupe portant le nom de l’agent l’emporte sur le joker, Allow l’emporte sur Disallow sur le même chemin, et renvoie le verdict pour les 10 agents d’IA les plus actifs aujourd’hui, séparés selon le rôle de chacun.

Comment ça marche
  1. 01

    Vous saisissez le domaine

    Le domaine seul, sans inscription. L’outil récupère robots.txt directement à la source, comme le ferait un robot.

  2. 02

    Les règles sont appliquées par agent

    Ce n’est pas une recherche de texte : le fichier est interprété comme l’exige le protocole, en respectant la priorité entre groupe spécifique et joker.

  3. 03

    Le verdict est séparé par rôle

    Les robots de recherche et ceux d’entraînement apparaissent dans des blocs distincts, car bloquer les uns est une décision marketing et bloquer les autres une décision de propriété intellectuelle.

Questions fréquentes
01

Qu’est-ce que robots.txt et pourquoi cela compte-t-il pour l’IA ?

C’est un fichier texte à la racine du site qui indique quels robots peuvent accéder à quels chemins. Les assistants d’IA respectent ce fichier : si votre domaine bloque OAI-SearchBot, ChatGPT ne peut pas ouvrir votre page pour la citer dans une réponse, même si elle est la meilleure source qui existe sur le sujet.
02

Quelle différence entre robot de recherche et robot d’entraînement ?

Le robot de recherche (OAI-SearchBot, PerplexityBot, Claude-SearchBot) lit votre page au moment où quelqu’un pose la question, pour composer la réponse et créditer la source par un lien. Le robot d’entraînement (GPTBot, Google-Extended, CCBot) collecte du contenu pour entraîner de futurs modèles, sans lien retour. Bloquer l’entraînement protège votre contenu ; bloquer la recherche vous sort de la réponse.
03

Bloquer GPTBot retire-t-il ma marque de ChatGPT ?

Pas directement. GPTBot est le collecteur d’entraînement d’OpenAI. Ceux qui recherchent en temps réel et citent la source sont OAI-SearchBot et ChatGPT-User. Vous pouvez bloquer l’entraînement et continuer à être cité, plusieurs médias font exactement cela.
04

Mon site n’a pas de robots.txt. Est-ce grave ?

Selon le protocole, l’absence du fichier signifie que tout est autorisé, donc aucun robot d’IA n’est bloqué. Ce n’est pas un problème de visibilité. C’est un problème si vous pensiez avoir le contrôle alors que ce n’était pas le cas.
05

Mon site bloque tout. Comment autoriser seulement les bons robots ?

Déclarez un groupe portant le nom de chaque agent que vous voulez autoriser. La règle du protocole est que le groupe nommé l’emporte sur le User-agent joker, qu’il soit avant ou après. Un groupe avec un Disallow vide autorise l’agent entièrement.
06

À quelle fréquence dois-je vérifier ?

À chaque changement de CMS, de CDN ou de plateforme d’e-commerce, beaucoup génèrent elles-mêmes le robots.txt et écrasent le vôtre. Vérifiez aussi lorsqu’un nouvel agent entre en circulation : la liste des robots d’IA a changé plusieurs fois depuis 2023.

robots.txt, c’est la porte. Et après ?

Laisser entrer l’IA est le minimum. Savoir ce qu’elle répond lorsqu’on l’interroge sur votre marque, et modifier cette réponse, c’est ce que fait la plateforme.