查看你的网站是否拦截了 AI 爬虫。
robots.txt 中的一行决定 ChatGPT、Claude 和 Perplexity 能否读取你的网站并引用你的品牌。输入域名,逐一查看 10 个重要代理。
- 所属模块
- AEO/GEO
- 输入
- 一个域名
- 运行位置
- Rovemark 服务器
- 费用
- 免费,无需注册
这个工具读什么
决定 AI 能否引用你的那个文件
robots.txt 位于域名根目录,是任何爬虫在打开页面前请求的第一项内容。网站在其中声明谁可以进入,谁不能进入。到 2023 年,这份名单只有一个受众:搜索引擎。如今它有两个,而大多数网站从未将两者区分开。
该工具获取你的 robots.txt,应用协议规则,具名代理组优先于通配符,同一路径中 Allow 优先于 Disallow,并返回目前最常见的 10 个 AI 代理的结论,按各自功能分类。
工作原理
- 01
输入域名
只要域名,无需注册。工具像爬虫那样,直接从源站取回 robots.txt。
- 02
按代理逐一套用规则
这不是文本搜索:文件按协议要求解析,尊重具名分组相对通配符的优先级。
- 03
结论按用途分开呈现
检索爬虫与训练爬虫分列两块,因为拦截前者是营销决定,拦截后者是知识产权决定。
常见问题
- 01
什么是 robots.txt?它为什么对 AI 重要?
- 这是网站根目录中的一个文本文件,用于声明哪些机器人可以访问哪些路径。AI 助手会遵守这个文件:如果你的域名拦截 OAI-SearchBot,ChatGPT 就无法打开你的页面并在回答中引用它,即使它是该主题最好的现有来源。
- 02
检索爬虫和训练爬虫有什么区别?
- 检索爬虫(OAI-SearchBot、PerplexityBot、Claude-SearchBot)在有人提问的当下读取你的页面,用来组织回答并以链接标注来源。训练爬虫(GPTBot、Google-Extended、CCBot)收集内容用于训练未来的模型,不会带回链接。拦截训练爬虫保护你的内容;拦截检索爬虫则把你从回答里剔除。
- 03
拦截 GPTBot 会让我的品牌从 ChatGPT 消失吗?
- 不直接影响。GPTBot 是 OpenAI 的训练采集器。负责实时搜索并引用来源的是 OAI-SearchBot 和 ChatGPT-User。你可以阻止训练,同时继续被引用,许多新闻媒体正是这样做的。
- 04
我的网站没有 robots.txt,这样不好吗?
- 按协议,没有该文件就表示一切都被允许,因此没有 AI 机器人被拦截。这不是可见性问题。如果你以为自己有控制权,其实没有,那才是问题。
- 05
我的网站拦截了一切,怎么只放行需要的爬虫?
- 为每个想放行的代理声明一个以其命名的分组。协议的规则是:具名分组胜过通配符 User-agent,无论写在前面还是后面。Disallow 留空的分组表示完全放行该代理。
- 06
应该多久检查一次?
- 每次更换 CMS、CDN 或电商平台时都要检查,很多平台会自行生成 robots.txt 并覆盖你的文件。新的代理开始流通时也值得检查:自 2023 年以来,AI 机器人列表已经变化过多次。
其他免费工具
