Ferramenta web / 02

Verificador de robots.txt

Transforme o arquivo robots.txt de um site em um relatório rápido e legível sobre a política de rastreamento.

Verificador de robots.txt: Leia as regras de rastreamento, os grupos de agentes, as declarações de sitemap e o código-fonte bruto do robots.txt de um site. A TOEA busca o arquivo na raiz do site e resume a política curinga para o caminho raiz. Isso ajuda a identificar bloqueios amplos e regras colocadas no lugar errado; a ferramenta não testa se todas as páginas podem ser indexadas. Processado com segurança sob demanda.

Execuções
No servidor da TOEA
Custo
Grátis · sem cadastro
Disponibilidade
Pronto para usar
Leitor de robots.txtVerificação segura de URL pública

A TOEA verifica o arquivo robots.txt na raiz do site.

Um exemplo curto de robots.txt

Coloque o arquivo na raiz do host, como /robots.txt. User-agent seleciona um grupo de rastreadores, Disallow solicita que esse grupo não busque os caminhos correspondentes, e Allow pode criar uma exceção. Este exemplo bloqueia um diretório privado, exceto sua pasta pública de imprensa, e declara um sitemap.

User-agent: *
Disallow: /private/
Allow: /private/press/

Sitemap: https://example.com/sitemap.xml

O caminho correspondente mais longo vence; Allow vence em caso de empate. Os caminhos diferenciam maiúsculas de minúsculas. As regras de grupos que correspondem ao mesmo agente são combinadas; um rastreador nomeado não herda as regras do grupo curinga. Referência do protocolo: https://www.rfc-editor.org/rfc/rfc9309.html

Erros comuns para verificar

Disallow: / bloqueia todos os caminhos, enquanto um valor vazio de Disallow não bloqueia nada. Um arquivo em /blog/robots.txt não controla a raiz do site, e as regras de um host não abrangem um subdomínio. Evite bloquear recursos necessários para que um mecanismo de busca renderize uma página.

Robots.txt controla o rastreamento, não o acesso nem a remoção garantida dos resultados de busca. Use autenticação para conteúdo privado. Para uma página pública que deve ser excluída da busca, permita o rastreamento e disponibilize-a com noindex. Este verificador resume grupos e a política da raiz curinga; ele não testa todas as URLs. Orientações de busca: https://developers.google.com/search/docs/crawling-indexing/robots/intro

Como usar

  1. Insira qualquer página do site que você quer verificar.
  2. Escolha “Verificar robots.txt”.
  3. Confira os grupos, totais de regras, sitemaps e o código-fonte completo.

Privacidade e limitações

A URL do site é enviada ao serviço de busca limitado da TOEA e não é armazenada. Um arquivo robots.txt tem caráter informativo; este relatório não comprova que todos os rastreadores seguirão suas regras.

Ferramentas relacionadas

Perguntas frequentes

Onde o robots.txt deve ficar?

Em /robots.txt no host que você quer controlar, como https://example.com/robots.txt. Um arquivo em /blog/ não controla o site inteiro, e um subdomínio precisa do próprio arquivo.

Disallow remove uma página dos resultados de busca?

Não. O robots.txt controla o rastreamento, não a indexação nem o acesso. Uma URL bloqueada ainda pode aparecer nos resultados de busca. Para excluir uma página pública, permita o rastreamento e disponibilize uma diretiva noindex; proteja conteúdo privado com autenticação.

Quais erros devo verificar primeiro?

Disallow: / bloqueia o site inteiro, enquanto um valor vazio em Disallow não bloqueia nada. Verifique caminhos que diferenciam maiúsculas de minúsculas, limites entre grupos e se recursos essenciais estão bloqueados. Um grupo de rastreador nomeado não herda regras do grupo curinga.

Ferramenta grátis · no servidor da toea execuções · não precisa de conta