ウェブツール / 02
robots.txtチェッカー
サイトのrobots.txtを、すぐに読めるクローラーポリシーレポートに変換します。
robots.txtチェッカー: サイトのrobots.txtに記載されたクローラーのルール、ユーザーエージェントグループ、サイトマップの宣言、ソース全体を読み取ります。TOEAはサイトのルートからファイルを取得し、ルートパスに対するワイルドカードポリシーを要約します。広範囲のブロックや配置場所を誤ったルールを見つけるのに役立ちますが、すべてのページがインデックス登録可能かどうかをテストするものではありません。 必要に応じて安全に処理します。
- カテゴリ
- Webツール
- 実行回数
- TOEAのサーバー上で
- コスト
- 無料 · 登録不要
- 提供状況
- すぐに使えます
robots.txtの短い例
ファイルはホストのルートに/robots.txtとして配置します。User-agentはクローラーのグループを選択し、Disallowはそのグループに一致するパスを取得しないよう指示します。Allowでは例外を指定できます。この例では、非公開ディレクトリをブロックしつつ、公開プレスフォルダーを例外にして、サイトマップを宣言しています。
User-agent: *
Disallow: /private/
Allow: /private/press/
Sitemap: https://example.com/sitemap.xml一致するパスが最も長いルールが優先され、同じ長さの場合はAllowが優先されます。パスでは大文字と小文字が区別されます。同じエージェントに一致するグループのルールは統合されます。名前を指定したクローラーは、ワイルドカードグループのルールを継承しません。プロトコルの参照: https://www.rfc-editor.org/rfc/rfc9309.html
よくある間違いを確認する
Disallow: /はすべてのパスをブロックしますが、空のDisallow値は何もブロックしません。/blog/robots.txtにあるファイルはサイトのルートを制御せず、あるホストのルールがサブドメインに適用されることもありません。検索エンジンがページを表示するために必要なアセットをブロックしないでください。
robots.txtはクロールを制御するものであり、アクセスや検索結果からの確実な削除を制御するものではありません。非公開コンテンツには認証を使ってください。検索から除外したい公開ページでは、クロールを許可したうえでnoindexを提供します。このチェッカーはグループとワイルドカードのルートポリシーを要約しますが、すべてのURLをテストするものではありません。検索に関する案内: https://developers.google.com/search/docs/crawling-indexing/robots/intro
使い方
- 確認したいサイト内のページを入力します。
- 「robots.txtをチェック」を選択します。
- グループ、ルールの合計、サイトマップ、ソース全体を確認します。
プライバシーと制限事項
サイトURLはTOEAの制限付きフェッチサービスに送信されますが、保存されません。robots.txtは助言的なものであり、このレポートによってすべてのクローラーがその内容に従うことが証明されるわけではありません。
関連ツール
よくある質問
robots.txtはどこに置けばよいですか?
制御したいホストの/robots.txtに置きます。たとえばhttps://example.com/robots.txtです。/blog/以下に置いたファイルではサイト全体を制御できず、サブドメインには独自のファイルが必要です。
Disallowを設定すると、ページは検索結果から削除されますか?
いいえ。robots.txtが制御するのはクロールであり、インデックス登録やアクセスではありません。ブロックされたURLでも検索結果に表示される場合があります。公開ページを除外するには、クロールを許可したうえでnoindexディレクティブを配信してください。非公開コンテンツは認証で保護します。
最初に確認すべきよくある間違いは何ですか?
Disallow: /はサイト全体をブロックします。一方、空のDisallow値は何もブロックしません。大文字と小文字が区別されるパス、グループの境界、重要なアセットがブロックされていないかを確認してください。名前を指定したクローラーグループは、ワイルドカードグループのルールを引き継ぎません。
無料ツール · toeaのサーバー上で · アカウント不要