Strumento web / 02

Strumento di verifica robots.txt

Trasforma il file robots.txt di un sito in un report rapido e leggibile sulle regole per i crawler.

Strumento di verifica robots.txt: Legge le regole per i crawler, i gruppi di agent, le dichiarazioni delle sitemap e il codice sorgente originale del file robots.txt di un sito. TOEA recupera il file dalla radice del sito e riassume la regola con carattere jolly per il percorso radice. Questo aiuta a individuare blocchi estesi e regole inserite nel posto sbagliato; non verifica se ogni pagina può essere indicizzata. Elaborazione sicura su richiesta.

Categoria
Strumenti Web
Esecuzioni
Sul server di TOEA
Costo
Gratuito · senza registrazione
Disponibilità
Pronto all'uso
Lettore di robots.txtControllo sicuro di un URL pubblico

TOEA controlla il file robots.txt nella root del sito.

Un breve esempio di robots.txt

Posiziona il file nella radice dell'host, all'indirizzo /robots.txt. User-agent seleziona un gruppo di crawler, Disallow chiede a quel gruppo di non recuperare i percorsi corrispondenti e Allow può creare un'eccezione. Questo esempio blocca una directory privata tranne la sua cartella pubblica per la stampa e dichiara una sitemap.

User-agent: *
Disallow: /private/
Allow: /private/press/

Sitemap: https://example.com/sitemap.xml

Vince il percorso corrispondente più lungo; in caso di parità vince Allow. I percorsi distinguono tra maiuscole e minuscole. Le regole dei gruppi che corrispondono allo stesso agente vengono combinate; un crawler nominato non eredita le regole del gruppo jolly. Riferimento al protocollo: https://www.rfc-editor.org/rfc/rfc9309.html

Errori comuni da verificare

Disallow: / blocca ogni percorso, mentre un valore Disallow vuoto non blocca nulla. Un file in /blog/robots.txt non controlla la radice del sito e le regole di un host non coprono un sottodominio. Evita di bloccare le risorse necessarie a un motore di ricerca per eseguire il rendering di una pagina.

Robots.txt controlla il crawling, non l'accesso né la rimozione garantita dai risultati di ricerca. Usa l'autenticazione per i contenuti privati. Per una pagina pubblica che deve essere esclusa dalla ricerca, consenti il crawling e fornisci noindex. Questo strumento di verifica riassume i gruppi e la policy della radice jolly; non esegue test su ogni URL. Indicazioni sulla ricerca: https://developers.google.com/search/docs/crawling-indexing/robots/intro

Come usarlo

  1. Inserisci una pagina qualsiasi del sito che vuoi controllare.
  2. Scegli «Verifica robots.txt».
  3. Esamina i gruppi, il totale delle regole, le sitemap e il codice sorgente completo.

Privacy e limitazioni

L’URL del sito viene inviato al servizio di recupero con limiti di TOEA e non viene memorizzato. Un file robots.txt ha valore indicativo; questo report non dimostra che ogni crawler lo seguirà.

Strumenti correlati

Domande frequenti

Dove deve trovarsi robots.txt?

In /robots.txt sull’host che vuoi controllare, ad esempio https://example.com/robots.txt. Un file in /blog/ non controlla l’intero sito e un sottodominio deve avere il proprio file.

Disallow rimuove una pagina dai risultati di ricerca?

No. Robots.txt controlla il crawling, non l’indicizzazione o l’accesso. Un URL bloccato può comunque comparire nei risultati di ricerca. Per escludere una pagina pubblica, consenti il crawling e invia una direttiva noindex; proteggi i contenuti privati con l’autenticazione.

Quali errori dovrei controllare per primi?

Disallow: / blocca l’intero sito, mentre un valore Disallow vuoto non blocca nulla. Controlla i percorsi che distinguono tra maiuscole e minuscole, i confini dei gruppi e l’eventuale blocco di risorse essenziali. Un gruppo di crawler nominato non eredita le regole dal gruppo con carattere jolly.

Strumento gratuito · sul server di toea esecuzioni · senza account