自社サイトがAI クローラーを遮断していないか。
robots.txtの1行で、ChatGPT、Claude、Perplexityが自社サイトを読み、自社ブランドを引用できるかが決まります。ドメインを入力して、重要な10のエージェントを一つずつ確認してください。
- モジュール
- AEO/GEO
- 入力
- ドメイン 1 件
- 実行場所
- Rovemark のサーバー
- 費用
- 無料・登録不要
このツールが読むもの
AI が引用できるかを決めるファイル
robots.txtはドメインのルートにあり、どのクローラーもページを開く前に最初に確認します。ここでサイトは、誰を入れ、誰を入れないかを宣言します。2023年までは、この一覧の対象は検索エンジンだけでした。今は二つあり、大半のサイトは両者を分けていません。
このツールはrobots.txtを取得し、プロトコルのルールを適用します。エージェント名付きのグループがワイルドカードより優先され、同じパスではAllowがDisallowより優先されます。現在最も使われている10のAIエージェントについて、それぞれの役割ごとに判定を返します。
仕組み
- 01
ドメインを入力する
ドメインだけ、登録は不要です。ツールはクローラーと同じように、オリジンから直接 robots.txt を取得します。
- 02
規則をエージェントごとに適用する
テキスト検索ではありません。プロトコルの要求どおりにファイルを解釈し、個別グループとワイルドカードの優先順位を守ります。
- 03
結果は役割ごとに分けて示す
検索クローラーと学習クローラーは別々のブロックに並びます。前者を遮断するのはマーケティングの判断、後者を遮断するのは知的財産の判断だからです。
よくある質問
- 01
robots.txt とは何で、なぜ AI にとって重要なのですか?
- サイトのルートに置くテキストファイルで、どのボットがどのパスにアクセスできるかを宣言します。AIアシスタントはこのファイルを尊重します。ドメインがOAI-SearchBotをブロックしている場合、たとえその話題で最高の情報源であっても、ChatGPTは回答で引用するためにそのページを開けません。
- 02
検索クローラーと学習クローラーの違いは何ですか?
- 検索クローラー(OAI-SearchBot、PerplexityBot、Claude-SearchBot)は、誰かが質問したその瞬間にページを読み、回答を組み立ててリンク付きで出典を示します。学習クローラー(GPTBot、Google-Extended、CCBot)は将来のモデルを学習させるために内容を集めますが、リンクは返しません。学習側を遮断すれば内容は守られ、検索側を遮断すれば回答から外れます。
- 03
GPTBot を遮断すると ChatGPT からブランドが消えますか?
- 直接は関係ありません。GPTBotはOpenAIの学習用クローラーです。リアルタイムで検索し、情報源を引用するのはOAI-SearchBotとChatGPT-Userです。学習をブロックしても引用され続けることは可能で、多くの報道機関がまさにそうしています。
- 04
robots.txt がありません。まずいのでしょうか?
- プロトコル上、ファイルがない場合はすべて許可されます。つまり、AIボットは一つもブロックされていません。可視性の問題ではありません。制御していると思っていたのに、実際はそうでなかった場合の問題です。
- 05
サイトがすべて遮断しています。必要なクローラーだけ通すには?
- 通したいエージェントごとに、その名前のグループを宣言してください。プロトコルの規則では、名前付きグループはワイルドカードの User-agent に優先します(前後どちらにあっても同じです)。Disallow を空にしたグループは、そのエージェントを全面的に許可します。
- 06
どのくらいの頻度で確認すべきですか?
- CMS、CDN、またはeコマースプラットフォームを変更するたびに確認してください。多くはrobots.txtを自動生成し、既存の設定を上書きします。新しいエージェントが登場したときも確認すべきです。AIボットの一覧は2023年以降何度も変わっています。
ほかの無料ツール
