Узнайте, ваш сайт ИИ-краулеров.
Одна строка в robots.txt решает, могут ли ChatGPT, Claude и Perplexity читать ваш сайт и упоминать ваш бренд. Введите домен и проверьте 10 важных агентов, по одному.
- Модуль
- AEO/GEO
- Ввод
- Домен
- Где работает
- Сервер Rovemark
- Стоимость
- Бесплатно, без регистрации
Файл, который решает, может ли ИИ вас процитировать
robots.txt находится в корне домена и это первое, что любой краулер запрашивает перед открытием страницы. В нём сайт указывает, кому разрешён доступ, а кому нет. До 2023 года у этого списка была только одна аудитория: поисковые системы. Сегодня их две, и большинство сайтов никогда не разделяли их.
Инструмент получает ваш robots.txt, применяет правила протокола, группа с именем агента имеет приоритет над шаблоном, Allow имеет приоритет над Disallow на одном пути, и выдаёт вердикт для 10 наиболее распространённых сегодня ИИ-агентов, разделённых по их функциям.
- 01
Вы вводите домен
Только домен, без регистрации. Инструмент забирает robots.txt прямо с источника, как это сделал бы краулер.
- 02
Правила применяются по каждому агенту
Это не текстовый поиск: файл разбирается так, как требует протокол, с соблюдением приоритета именованной группы над подстановочной.
- 03
Вердикт выводится по ролям
Поисковые и обучающие боты показаны отдельными блоками, потому что блокировка одних, это маркетинговое решение, а блокировка других, решение в сфере интеллектуальной собственности.
- 01
Что такое robots.txt и почему он важен для ИИ?
- Это текстовый файл в корне сайта, который указывает, каким ботам доступны какие пути. ИИ-ассистенты соблюдают этот файл: если ваш домен блокирует OAI-SearchBot, ChatGPT не сможет открыть вашу страницу, чтобы процитировать её в ответе, даже если это лучший источник по теме.
- 02
Чем поисковый краулер отличается от обучающего?
- Поисковый бот, OAI-SearchBot, PerplexityBot, Claude-SearchBot, читает вашу страницу в момент, когда кто-то задаёт вопрос, чтобы составить ответ и указать источник ссылкой. Обучающий бот, GPTBot, Google-Extended, CCBot, собирает контент для обучения будущих моделей, без обратной ссылки. Блокировка обучающего бота защищает ваш контент, блокировка поискового бота исключает вас из ответа.
- 03
Если заблокировать GPTBot, бренд исчезнет из ChatGPT?
- Не напрямую. GPTBot, это бот OpenAI для сбора данных на обучение. В реальном времени ищут и цитируют источник OAI-SearchBot и ChatGPT-User. Можно заблокировать обучение и по-прежнему получать цитирование, именно так поступают многие новостные издания.
- 04
У моего сайта нет robots.txt. Это плохо?
- По протоколу отсутствие файла означает, что разрешено всё, поэтому ни один ИИ-бот не заблокирован. Это не проблема видимости. Это проблема, если вы думали, что у вас был контроль, а его не было.
- 05
Мой сайт блокирует всё. Как открыть только нужных краулеров?
- Объявите группу с именем каждого агента, которому хотите разрешить доступ. Правило протокола такое: именованная группа имеет приоритет над шаблонным User-agent, независимо от того, расположена она до или после него. Группа с пустым Disallow разрешает агенту полный доступ.
- 06
Как часто это проверять?
- Всегда, когда меняете CMS, CDN или платформу электронной коммерции, многие из них сами создают robots.txt и перезаписывают ваш. Также стоит проверять, когда появляется новый агент: список ИИ-ботов несколько раз менялся с 2023 года.
robots.txt, это дверь. А что за ней?
Разрешить ИИ войти, это минимум. Знать, что он отвечает, когда его спрашивают о вашем бренде, и менять этот ответ, вот что делает платформа.
