AIクローラーの許可・ブロック設定(GPTBot / ClaudeBot / PerplexityBot)
AIクローラーはrobots.txtに従います。重要なのは、多くのAI事業者が「学習用」と「回答生成用」で別々のボットを運用している点です。区別せずに一括ブロックすると、AI検索の回答に自社が一切登場しなくなります。
公開日: 2026年8月16日 / 最終更新日: 2026年9月6日
2種類のボットがある
AI事業者のクローラーは、目的別に分かれています。この違いを理解しないまま設定すると、意図と逆の結果になります。
- 学習用クローラー: モデルの訓練データを集めます。ブロックしても、AI検索の回答に出なくなるわけではありません
- 回答生成・検索用クローラー: 利用者が質問した時点で情報を取りに来ます。ここをブロックすると、AI検索の回答で自社が引用されなくなります
「AIに学習されたくない」のか「AI検索にも出たくない」のかで、設定すべき対象が変わります。多くの企業サイトにとっては、学習は拒否しつつ回答生成には使ってもらう、という選択が現実的です。
主要なユーザーエージェント
- GPTBot(OpenAI / 学習用)
- OAI-SearchBot(OpenAI / ChatGPTの検索機能)
- ChatGPT-User(OpenAI / 利用者の操作に応じた取得)
- ClaudeBot(Anthropic / 学習用)
- Claude-SearchBot、Claude-User(Anthropic / 検索・利用者操作)
- PerplexityBot(Perplexity / 検索インデックス)
- Google-Extended(Googleの生成AI向け。通常のGooglebotとは別枠で、検索順位には影響しません)
- CCBot(Common Crawl。多くのAI学習データの元になっています)
ボットの名称と仕様は変わることがあります。設定する前に、各社が公開している最新のドキュメントで確認してください。
設定例
まず、多くのサイトに適した設定です。学習は拒否しつつ、AI検索の回答には使ってもらう形になります。
学習は拒否・AI検索は許可
# 通常の検索エンジン
User-agent: *
Allow: /
Disallow: /admin
# 学習用クローラーを拒否
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
# 回答生成用は許可(記述しなければ User-agent: * が適用され許可されます)
Sitemap: https://example.com/sitemap.xml逆に、AI検索での露出を積極的に取りにいくなら、学習用も含めて特に制限しない選択もあります。判断の分かれ目は、コンテンツ自体が商品かどうかです。記事や調査そのもので収益を得ているなら学習拒否に合理性がありますし、コンテンツが集客手段なら露出優先のほうが筋が通ります。
ブロックすると何が起きるか
- 学習用のみブロック → 将来のモデルの訓練データに含まれにくくなる。AI検索の回答には引き続き登場し得る
- 回答生成用もブロック → AI検索の回答で引用されなくなる。競合だけが引用される状態になり得る
- 全部ブロック → AI経由の認知と流入を放棄することになる
なお、robots.txtは強制力のある仕組みではなく、あくまで遵守を前提とした取り決めです。2025年8月にはCloudflareが、Perplexityが宣言していないクローラーを用いて拒否指定を回避していたとする調査を公開しています。確実に遮断したい場合は、サーバー側やCDNでのアクセス制御が必要になります。
設定後の確認方法
- robots.txtが正しいURL(サイト直下の /robots.txt)で配信され、200を返すこと
- User-agentごとの記述の順序と、ブロックの範囲が意図どおりか
- サーバーのアクセスログで、対象ボットの挙動が変わったかを確認する
- Smash SEOのログ解析機能を使うと、どのクローラーがどのページに来ているかを一覧で確認できます
注意点
AIクローラーを拒否しても、Googleの検索順位には影響しません。Google-ExtendedはGooglebotとは別枠で、生成AI向けの利用可否のみを制御します。ここを混同して「AI拒否したら検索順位が落ちる」と考える必要はありません。
また、robots.txtでブロックしたページでも、外部からリンクされていればURL自体が参照されることはあります。確実に見せたくない情報は、そもそも認証の内側に置いてください。
よくある質問
AIクローラーをブロックするとGoogleの順位は下がりますか?
下がりません。Google-ExtendedはGooglebotと別枠で、検索のクロールとインデックスには影響しません。
一度学習されたデータは消せますか?
既に訓練に使われたデータを遡って取り除くことは、一般に困難です。robots.txtでの拒否は今後の取得に対して効きます。
どのボットを許可すべきか迷います。
コンテンツ自体が商品(有料記事、独自調査)なら学習拒否に合理性があります。コンテンツが集客手段なら、露出を優先して許可するほうが目的に合います。
関連記事
- AIクローラーはどのページを見に来ているか — アクセスログの読み方
robots.txtの設定が「意図」だとすれば、アクセスログは「実際に何が起きたか」の記録です。AIクローラーが本当に来ているのか、どのページを読んでいるのかは、ログを見れば事実として分かります。推測で議論する必要はありません。 - llms.txt とは?書き方と、現時点でどこまで効くのか
llms.txt は、サイトの要点をLLM向けにMarkdownでまとめて置く提案です。robots.txt に似た位置づけですが、標準として確立したものではなく、効果を断定できる段階にはありません。導入コストが低いため試す価値はある、というのが現実的な評価です。 - robots.txtでクロールがブロックされている
robots.txtでブロックされたURLは、検索エンジンがページの中身を取得できません。意図的なら正しい設定ですが、意図せずブロックしていると、そのページは内容を評価されないまま検索結果から実質的に外れます。 - ReactのサイトがAIから見えない問題 — 実際に直した記録
これは他人事の解説ではなく、当サイト自身の失敗と修正の記録です。技術SEO診断ツールのサイトでありながら、生HTMLの本文はわずか8文字で、AIクローラーからはほぼ白紙に見えていました。どう発見し、どう直したかをそのまま公開します。