Ferramenta web / 02
Verificador de robots.txt
Transforme o arquivo robots.txt de um site em um relatório rápido e legível sobre a política de rastreamento.
Verificador de robots.txt: Leia as regras de rastreamento, os grupos de agentes, as declarações de sitemap e o código-fonte bruto do robots.txt de um site. A TOEA busca o arquivo na raiz do site e resume a política curinga para o caminho raiz. Isso ajuda a identificar bloqueios amplos e regras colocadas no lugar errado; a ferramenta não testa se todas as páginas podem ser indexadas. Processado com segurança sob demanda.
- Categoria
- Ferramentas web
- Execuções
- No servidor da TOEA
- Custo
- Grátis · sem cadastro
- Disponibilidade
- Pronto para usar
Um exemplo curto de robots.txt
Coloque o arquivo na raiz do host, como /robots.txt. User-agent seleciona um grupo de rastreadores, Disallow solicita que esse grupo não busque os caminhos correspondentes, e Allow pode criar uma exceção. Este exemplo bloqueia um diretório privado, exceto sua pasta pública de imprensa, e declara um sitemap.
User-agent: *
Disallow: /private/
Allow: /private/press/
Sitemap: https://example.com/sitemap.xmlO caminho correspondente mais longo vence; Allow vence em caso de empate. Os caminhos diferenciam maiúsculas de minúsculas. As regras de grupos que correspondem ao mesmo agente são combinadas; um rastreador nomeado não herda as regras do grupo curinga. Referência do protocolo: https://www.rfc-editor.org/rfc/rfc9309.html
Erros comuns para verificar
Disallow: / bloqueia todos os caminhos, enquanto um valor vazio de Disallow não bloqueia nada. Um arquivo em /blog/robots.txt não controla a raiz do site, e as regras de um host não abrangem um subdomínio. Evite bloquear recursos necessários para que um mecanismo de busca renderize uma página.
Robots.txt controla o rastreamento, não o acesso nem a remoção garantida dos resultados de busca. Use autenticação para conteúdo privado. Para uma página pública que deve ser excluída da busca, permita o rastreamento e disponibilize-a com noindex. Este verificador resume grupos e a política da raiz curinga; ele não testa todas as URLs. Orientações de busca: https://developers.google.com/search/docs/crawling-indexing/robots/intro
Como usar
- Insira qualquer página do site que você quer verificar.
- Escolha “Verificar robots.txt”.
- Confira os grupos, totais de regras, sitemaps e o código-fonte completo.
Privacidade e limitações
A URL do site é enviada ao serviço de busca limitado da TOEA e não é armazenada. Um arquivo robots.txt tem caráter informativo; este relatório não comprova que todos os rastreadores seguirão suas regras.
Ferramentas relacionadas
Perguntas frequentes
Onde o robots.txt deve ficar?
Em /robots.txt no host que você quer controlar, como https://example.com/robots.txt. Um arquivo em /blog/ não controla o site inteiro, e um subdomínio precisa do próprio arquivo.
Disallow remove uma página dos resultados de busca?
Não. O robots.txt controla o rastreamento, não a indexação nem o acesso. Uma URL bloqueada ainda pode aparecer nos resultados de busca. Para excluir uma página pública, permita o rastreamento e disponibilize uma diretiva noindex; proteja conteúdo privado com autenticação.
Quais erros devo verificar primeiro?
Disallow: / bloqueia o site inteiro, enquanto um valor vazio em Disallow não bloqueia nada. Verifique caminhos que diferenciam maiúsculas de minúsculas, limites entre grupos e se recursos essenciais estão bloqueados. Um grupo de rastreador nomeado não herda regras do grupo curinga.
Ferramenta grátis · no servidor da toea execuções · não precisa de conta