Tools

Zie of je site AI-crawlers blokkeert.

Eén regel in robots.txt bepaalt of ChatGPT, Claude en Perplexity je site kunnen lezen en je merk kunnen citeren. Voer het domein in en bekijk de 10 agents die ertoe doen, één voor één.

Module
AEO/GEO
Invoer
Een domein
Draait op
Rovemark-server
Kosten
Gratis, zonder registratie
Wat de tool leest

Het bestand dat bepaalt of AI je mag citeren

robots.txt staat in de hoofdmap van het domein en is het eerste wat elke crawler opvraagt voordat hij een pagina opent. Daarin verklaart de site wie er wel en niet binnenkomt. Tot 2023 had deze lijst maar één publiek: zoekmachines. Nu zijn het er twee, en de meeste sites hebben die nooit van elkaar gescheiden.

De tool haalt je robots.txt op, past de regels van het protocol toe, een groep met agentnaam wint van de wildcard, Allow wint van Disallow op hetzelfde pad, en geeft het oordeel terug voor de 10 AI agents die nu het meest actief zijn, gescheiden naar wat ieder doet.

Hoe het werkt
  1. 01

    Je vult het domein in

    Alleen het domein, zonder registratie. De tool haalt robots.txt rechtstreeks bij de bron op, zoals een crawler zou doen.

  2. 02

    De regels worden per agent toegepast

    Het is geen tekstzoekopdracht: het bestand wordt gelezen zoals het protocol voorschrijft, inclusief voorrang van de specifieke groep boven de wildcard.

  3. 03

    Het oordeel komt gescheiden naar rol

    Zoek- en trainingscrawlers verschijnen in aparte blokken, want de een blokkeren is een marketingbeslissing en de ander blokkeren een beslissing over intellectueel eigendom.

Veelgestelde vragen
01

Wat is robots.txt en waarom telt het voor AI?

Het is een tekstbestand in de hoofdmap van de site dat aangeeft welke robots toegang hebben tot welke paden. AI assistenten respecteren dit bestand: als je domein OAI-SearchBot blokkeert, kan ChatGPT je pagina niet openen om die in een antwoord te citeren, ook al is het de beste bron over het onderwerp.
02

Wat is het verschil tussen een zoek- en een trainingscrawler?

De zoekcrawler (OAI-SearchBot, PerplexityBot, Claude-SearchBot) leest je pagina op het moment dat iemand iets vraagt, om het antwoord te bouwen en de bron met een link te noemen. De trainingscrawler (GPTBot, Google-Extended, CCBot) verzamelt inhoud om toekomstige modellen te trainen, zonder link terug. De trainingscrawler blokkeren beschermt je inhoud; de zoekcrawler blokkeren haalt je uit het antwoord.
03

Haalt GPTBot blokkeren mijn merk uit ChatGPT?

Niet rechtstreeks. GPTBot is de trainingscrawler van OpenAI. OAI-SearchBot en ChatGPT-User zoeken in realtime en citeren de bron. Je kunt training blokkeren en toch geciteerd blijven worden, verschillende nieuwsmedia doen precies dat.
04

Mijn site heeft geen robots.txt. Is dat erg?

Volgens het protocol betekent het ontbreken van het bestand dat alles is toegestaan, dus geen enkele AI robot wordt geblokkeerd. Het is geen zichtbaarheidsprobleem. Het is een probleem als je dacht dat je controle had en dat niet zo was.
05

Mijn site blokkeert alles. Hoe laat ik alleen de juiste crawlers toe?

Declareer een groep met de naam van elke agent die je wilt toelaten. De regel van het protocol is dat de benoemde groep wint van de wildcard-User-agent, of die er nu vóór of ná staat. Een groep met een lege Disallow laat die agent volledig toe.
06

Hoe vaak moet ik dit controleren?

Telkens wanneer je van CMS, CDN of e-commerceplatform wisselt, veel daarvan genereren zelf robots.txt en overschrijven dat van jou. Controleer het ook wanneer een nieuwe agent in omloop komt: de lijst met AI robots is sinds 2023 meerdere keren veranderd.

robots.txt is de deur. En daarachter?

AI toegang geven is het minste. Weten wat zij antwoordt wanneer mensen naar je merk vragen, en dat antwoord veranderen, is wat het platform doet.