AI クローラーをブロックする robots.txt|GPTBot・ClaudeBot
自分のサイトの文章や画像を AI の学習に使われたくない、という声が増えています。robots.txt に AI のクローラーの名前を書けば、各社のクローラーに取得をやめるよう伝えられます。ただし、AI のクローラーには「学習用」「AI 検索用」「ユーザーの指示で開くもの」があり、どれを止めるかで影響が大きく変わります。この記事では、主な AI クローラーの名前と役割、目的別の robots.txt の書き方、止めるときの注意点をまとめます。
AI クローラーは3種類に分けて考える
AI の会社の多くは、用途ごとにクローラーの名前を分けています。robots.txt では名前ごとに止めるかどうかを決められるので、まず役割の違いを押さえておきます。
- 学習用:AI のモデルを作るために、公開されているページを集めるクローラー。止めると、今後の学習データに使われにくくなります。
- AI 検索用:ChatGPT の検索や Perplexity など、AI が回答の中でサイトを紹介・引用するためにページを集めるクローラー。止めると、そうした回答で紹介されにくくなります。
- ユーザーの指示での取得:利用者が「このページを読んで」と頼んだときに、その場でページを開くもの。会社によっては robots.txt の対象外としています。
主な AI クローラーの名前と役割
| User-agent | 会社 | 役割 |
|---|---|---|
| GPTBot | OpenAI | 学習 |
| OAI-SearchBot | OpenAI | ChatGPT の検索 |
| ChatGPT-User | OpenAI | ユーザーの指示での取得 |
| ClaudeBot | Anthropic | 学習 |
| Claude-SearchBot | Anthropic | Claude の検索 |
| Claude-User | Anthropic | ユーザーの指示での取得 |
| Google-Extended | Gemini などの学習・回答への利用(Google 検索には影響しない) | |
| Applebot-Extended | Apple | Apple Intelligence などの学習(Apple の検索には影響しない) |
| meta-externalagent | Meta | 学習 |
| CCBot | Common Crawl | 公開データセット(多くの AI の学習に使われる) |
| Bytespider | ByteDance | 学習など |
| Amazonbot | Amazon | Alexa などのサービスの改善 |
| PerplexityBot | Perplexity | Perplexity の検索 |
名前は各社が公開しているもので、新しいクローラーが増えたり名前が変わったりすることがあります。止める前に、各社の公式の案内で最新の名前を確かめてください。
目的別の robots.txt の書き方
- 1
AI の学習だけを止めて、検索や AI 検索には出す
User-agent: GPTBot/User-agent: ClaudeBot/User-agent: Google-Extended/User-agent: Applebot-Extended/User-agent: meta-externalagent/User-agent: CCBot の6行のあとに「Disallow: /」を1行。User-agent: * のグループには手を加えません。いちばん影響の少ない止め方です。
- 2
AI 検索での引用も止める
上の名前に OAI-SearchBot・Claude-SearchBot・PerplexityBot を足します。ChatGPT や Perplexity の回答でサイトが紹介されにくくなるので、AI からの流入を見込んでいるサイトでは慎重に決めます。
- 3
一部のフォルダだけ学習に使わせない
「Disallow: /」の代わりに「Disallow: /members/」「Disallow: /illust/」のように止めたいフォルダだけを書きます。ブログ記事は使ってよいが、イラストや有料記事は使わせたくない、といった分け方ができます。
テスターの「AI クローラーのブロックを作る」では、「学習だけ」「AI 検索も」「全部」から選ぶと、その行をまとめて作れます。作った行を robots.txt に足して、Googlebot は許可・GPTBot はブロック、のように意図どおりの結果になるかを判定で確かめてから公開してください。複数の名前を1つのグループにまとめる書き方はUser-agent の書き方で解説しています。
Google 検索・AI による概要への影響
- Google-Extended を止めても、Google 検索の順位や表示には影響しません。
- Google 検索の「AI による概要」は Google 検索の一部として扱われるため、Google-Extended では止められません。表示されたくないときは、ページの nosnippet などの指定を使います。
- Googlebot を止めると Google 検索そのものからも消えていくので、AI 対策のつもりで Googlebot を止めるのは避けます。
- Applebot-Extended を止めても、Siri や Spotlight の検索に使われる Applebot には影響しません。
robots.txt でできること・できないこと
robots.txt は「このページは取りに来ないでください」というお願いで、強制力はありません。名前を公開して robots.txt を守ると表明している大手のクローラーには効果がありますが、名前を偽るクローラーや robots.txt を読まないクローラーは止められません。
- すでに学習に使われたデータは、robots.txt を書き足しても取り消されません。効果があるのはこれから先の取得です。
- ほかのサイトに転載された文章や、Common Crawl などのデータセットに過去に含まれた分は、自分のサイトの robots.txt では止められません。
- 確実に止めたいなら、サーバーやCDN の設定で特定の User-agent や IP アドレスからのアクセスを拒否する方法もあります。
- ページを検索結果から消すのとクロールを止めるのは別のことです。違いはrobots.txt と noindex の違いで解説しています。
よくある質問
- ChatGPT にサイトを学習させないにはどうすればいいですか?
- robots.txt に「User-agent: GPTBot」と「Disallow: /」を書きます。OpenAI の学習用クローラーが取得をやめます。ChatGPT の検索での表示に使う OAI-SearchBot は別の名前なので、検索には出したい場合はそのままにします。
- Google-Extended を止めると Google 検索の順位は下がりますか?
- 下がりません。Google-Extended は Gemini などの AI に使うかどうかだけを決める名前で、Google 検索のクロールやランキングには使われません。
- AI クローラーを止めると AI 検索に出なくなりますか?
- 学習用の GPTBot や ClaudeBot だけを止めた場合は、AI 検索用の OAI-SearchBot や Claude-SearchBot は引き続き取得できます。AI 検索用の名前まで止めると、その回答で紹介されにくくなります。
- robots.txt に書けば AI の学習を必ず止められますか?
- 必ずではありません。robots.txt は守るかどうかがクローラーに任されたお願いです。大手の会社のクローラーは守ると表明していますが、すでに集められたデータや、転載先のデータは止められません。
この記事で紹介したツール
あわせて読みたい
robots.txt の User-agent の書き方|* と Googlebot を両方書くと
robots.txt に「User-agent: *」のグループと「User-agent: Googlebot」のグループの両方を書くと、Googlebot は「*」のルールを使わなくなります。これを知らずに Googlebot 用のグループを足して、止めていたはずのページがクロールされるようになった、というトラブルはよくあります。この記事では、クローラーがどのグループを使うかの決まり方、Googlebot-Image や AdsBot-Google などの特別な扱い、グループのまとめ方と書き間違いやすい点を解説します。
記事を読む →robots.txt の確認方法|テスター廃止後にブロックを調べる手順
Google Search Console にあった robots.txt テスターは2023年12月に提供が終わり、今は「robots.txt レポート」に置き換わっています。レポートでは「URL を入れてブロックされるか試す」ことができないため、「どこで確認すればいいの?」と迷う人が増えました。この記事では、robots.txt の置き場所と開き方、Search Console のレポートと URL 検査ツールで分かること・分からないこと、テスターで URL ごとの判定を確かめる手順、書き換えたあとに反映されるまでの流れをまとめます。
記事を読む →robots.txt の Allow と Disallow の優先順位|* と $ の意味
robots.txt で同じ URL に Allow と Disallow の両方が当てはまるとき、どちらが使われるのか。「上に書いたほうが優先」と思われがちですが、Google の読み方は違います。この記事では、Google が採用している「いちばん長く一致したルールが勝つ」仕組み、ワイルドカード「*」と末尾の「$」の意味、「/fish」と「/fish/」の違い、大文字小文字や日本語の URL の扱いを、例を使って解説します。
記事を読む →