robots.txt の確認方法|テスター廃止後にブロックを調べる手順
Google Search Console にあった robots.txt テスターは2023年12月に提供が終わり、今は「robots.txt レポート」に置き換わっています。レポートでは「URL を入れてブロックされるか試す」ことができないため、「どこで確認すればいいの?」と迷う人が増えました。この記事では、robots.txt の置き場所と開き方、Search Console のレポートと URL 検査ツールで分かること・分からないこと、テスターで URL ごとの判定を確かめる手順、書き換えたあとに反映されるまでの流れをまとめます。
robots.txt テスターはなくなり「robots.txt レポート」に
以前の Search Console には、robots.txt の中身を書き換えながら「この URL は Googlebot にブロックされるか」を試せる robots.txt テスターがありました。Google は2023年11月に終了を告知し、12月に提供を終えています。代わりにできたのが、「設定」の中にある「robots.txt レポート」です。
| 確かめたいこと | robots.txt レポート | URL 検査ツール | robots.txt テスター(このサイト) |
|---|---|---|---|
| Google が robots.txt を取得できたか | 分かる | — | — |
| 最後に取得した日時と中身 | 分かる | — | — |
| 文法エラー・警告の行 | 分かる(Google が読めなかった行) | — | 分かる(全角・URL・Noindex なども) |
| ある URL がブロックされるか | 分からない | 公開中の URL なら分かる | 分かる(公開前の書き換え案でも) |
| 決め手になったルールの行 | 分からない | 分からない | 分かる |
| Googlebot 以外のクローラー | 分からない | 分からない | Bingbot・GPTBot など23種 |
レポートは「Google が今どの robots.txt を読んでいるか」を知るための画面で、書き換える前の案を試すことはできません。URL 検査ツールは公開中の URL について「robots.txt によるブロック」の有無を教えてくれますが、どの行が原因かまでは表示されません。書き換える前に影響を確かめたいときは、テスターに案を貼って判定するのがいちばん早い方法です。
robots.txt の置き場所と開き方
robots.txt は、サイトのいちばん上の階層に「robots.txt」という名前で置きます。ブラウザで「https://ドメイン/robots.txt」を開くと、今公開されている中身を確認できます。
- 置き場所は1つだけ:https://example.com/robots.txt は読まれますが、https://example.com/blog/robots.txt のような下の階層に置いたファイルは読まれません。
- ドメインごとに別物:www.example.com と example.com、shop.example.com のようなサブドメインは、それぞれに robots.txt が必要です。
- http と https、ポート番号も別:http://example.com/robots.txt の内容は https:// のページには使われません。
- ファイル名は小文字:Robots.txt や ROBOTS.TXT では読まれないことがあります。
- 文字コードは UTF-8:日本語のパスやコメントを書くなら UTF-8 で保存します。
テスターで URL ごとのブロックを確かめる手順
- 1
robots.txt の中身をコピーして貼りつける
https://ドメイン/robots.txt を開いて全部コピーし、テスターの「robots.txt の中身」に貼ります。書き換えの案があるなら、公開前の案を貼ってもかまいません。
- 2
確かめたい URL を1行に1つずつ入れる
「https://example.com/blog/」のような URL でも、「/blog/」のようなパスだけでも判定できます。トップページ、記事、カテゴリ、検索結果、画像、PDF など、種類の違う URL を並べると漏れを見つけやすくなります。
- 3
判定したいクローラーを選ぶ
まずは Googlebot と Bingbot。画像検索を気にするなら Googlebot-Image、広告を出しているなら AdsBot-Google と Mediapartners-Google、AI の扱いを決めたいなら GPTBot や ClaudeBot も選びます。
- 4
結果の表と決め手のルールを見る
URL × クローラーごとに「許可」「ブロック」が出ます。URL を開くと、決め手になったルールの行番号と、使われたグループ(User-agent)が分かります。思っていたのと違う結果なら、その行を見直します。
- 5
「書き方のチェック」を直してもう一度判定する
全角の「:」や、Disallow に URL を書いた行など、Google が意図どおりに読まない書き方を行番号つきで知らせます。直したら同じ URL でもう一度判定し、結果が変わらないことを確かめてから公開します。
判定のルールの詳しい中身はAllow と Disallow の優先順位、Googlebot 用のグループを足したときの注意はUser-agent の書き方で解説しています。
書き換えたあと Google に反映されるまで
robots.txt を書き換えても、Google がすぐに新しい中身を使うわけではありません。Google は取得した robots.txt を通常24時間ほどキャッシュし、その間は古い中身でクロールを続けます。
- 急ぐとき:Search Console の robots.txt レポートで、該当の robots.txt の「︙」から再クロールをリクエストできます。
- 反映を確かめる:レポートの「最終クロール日時」が書き換えたあとになり、表示される中身が新しくなっていれば反映済みです。
- 検索結果への影響はもっと遅い:クロールを止めても、すでに検索結果にある URL がすぐ消えるわけではありません。逆にブロックを外しても、再クロールされて評価が戻るまで時間がかかります。
robots.txt のアクセスでサーバーがエラーを返すと、Google のふるまいが変わる点にも注意が必要です。404 などの「見つからない」は「制限なし(全部許可)」として扱われますが、500 番台のエラーやタイムアウトが続くと、Google はしばらくサイト全体のクロールを止めます。メンテナンス中に robots.txt だけがエラーになっていないかは、レポートの取得ステータスで確かめられます。
確認のときに見落としやすいポイント
- 本番と開発環境の取り違え:公開前のサイトで書いた「Disallow: /」を、そのまま本番に持ち込んでいないか。サイト全体が少しずつ検索結果から消えていく典型的な原因です。
- CSS・JavaScript のブロック:/assets/ や /wp-includes/ を止めると、Google がページを正しく表示できず、スマホ対応などの評価に影響することがあります。
- 大文字小文字:「Disallow: /Admin/」は /admin/ を止めません。URL の実際の書き方と同じかを確かめます。
- ファイルの大きさ:Google が読むのは先頭の500KiB までです。自動生成で何千行にもなっている robots.txt は、後ろのルールが無視されている可能性があります。
- noindex との組み合わせ:検索結果から消したいページを robots.txt で止めると、noindex が読まれずに残り続けます。詳しくはrobots.txt と noindex の違いを参照してください。
よくある質問
- Search Console の robots.txt テスターはどこにありますか?
- 2023年12月に提供が終わり、今はありません。代わりに「設定」→「robots.txt」のレポートで、Google が取得した robots.txt の中身・取得日時・エラーを確認できます。URL ごとのブロックの判定は、URL 検査ツール(公開中の URL のみ)か、robots.txt テスターで確かめます。
- robots.txt を書き換えたらすぐ反映されますか?
- Google は robots.txt を通常24時間ほどキャッシュするため、すぐには反映されません。急ぐときは Search Console の robots.txt レポートから再クロールをリクエストできます。
- robots.txt がないとどうなりますか?
- robots.txt が見つからない(404)ときは、「制限なし」としてすべての URL がクロールの対象になります。止めたいページがなければ、robots.txt を置かなくても問題はありません。
- サブドメインにも robots.txt は必要ですか?
- 必要です。robots.txt はホストごとに別々に読まれるので、blog.example.com のルールを example.com/robots.txt に書いても使われません。それぞれのサブドメインの一番上に置きます。
この記事で紹介したツール
あわせて読みたい
robots.txt と noindex の違い|検索結果から消す正しい方法
「robots.txt でブロックしたのに検索結果に出てくる」「Search Console に『robots.txt によりブロックされましたが、インデックスに登録しました』と出た」。こうした悩みの多くは、robots.txt と noindex の役割の違いから来ています。この記事では、クロールとインデックスの違い、検索結果から消したいときの正しい手順、robots.txt の Noindex や Crawl-delay が効かない理由、Search Console でよく見るメッセージと書き間違いの直し方をまとめます。
記事を読む →robots.txt の Allow と Disallow の優先順位|* と $ の意味
robots.txt で同じ URL に Allow と Disallow の両方が当てはまるとき、どちらが使われるのか。「上に書いたほうが優先」と思われがちですが、Google の読み方は違います。この記事では、Google が採用している「いちばん長く一致したルールが勝つ」仕組み、ワイルドカード「*」と末尾の「$」の意味、「/fish」と「/fish/」の違い、大文字小文字や日本語の URL の扱いを、例を使って解説します。
記事を読む →robots.txt の User-agent の書き方|* と Googlebot を両方書くと
robots.txt に「User-agent: *」のグループと「User-agent: Googlebot」のグループの両方を書くと、Googlebot は「*」のルールを使わなくなります。これを知らずに Googlebot 用のグループを足して、止めていたはずのページがクロールされるようになった、というトラブルはよくあります。この記事では、クローラーがどのグループを使うかの決まり方、Googlebot-Image や AdsBot-Google などの特別な扱い、グループのまとめ方と書き間違いやすい点を解説します。
記事を読む →