Strumento web / 02
Strumento di verifica robots.txt
Trasforma il file robots.txt di un sito in un report rapido e leggibile sulle regole per i crawler.
Strumento di verifica robots.txt: Legge le regole per i crawler, i gruppi di agent, le dichiarazioni delle sitemap e il codice sorgente originale del file robots.txt di un sito. TOEA recupera il file dalla radice del sito e riassume la regola con carattere jolly per il percorso radice. Questo aiuta a individuare blocchi estesi e regole inserite nel posto sbagliato; non verifica se ogni pagina può essere indicizzata. Elaborazione sicura su richiesta.
- Categoria
- Strumenti Web
- Esecuzioni
- Sul server di TOEA
- Costo
- Gratuito · senza registrazione
- Disponibilità
- Pronto all'uso
Un breve esempio di robots.txt
Posiziona il file nella radice dell'host, all'indirizzo /robots.txt. User-agent seleziona un gruppo di crawler, Disallow chiede a quel gruppo di non recuperare i percorsi corrispondenti e Allow può creare un'eccezione. Questo esempio blocca una directory privata tranne la sua cartella pubblica per la stampa e dichiara una sitemap.
User-agent: *
Disallow: /private/
Allow: /private/press/
Sitemap: https://example.com/sitemap.xmlVince il percorso corrispondente più lungo; in caso di parità vince Allow. I percorsi distinguono tra maiuscole e minuscole. Le regole dei gruppi che corrispondono allo stesso agente vengono combinate; un crawler nominato non eredita le regole del gruppo jolly. Riferimento al protocollo: https://www.rfc-editor.org/rfc/rfc9309.html
Errori comuni da verificare
Disallow: / blocca ogni percorso, mentre un valore Disallow vuoto non blocca nulla. Un file in /blog/robots.txt non controlla la radice del sito e le regole di un host non coprono un sottodominio. Evita di bloccare le risorse necessarie a un motore di ricerca per eseguire il rendering di una pagina.
Robots.txt controlla il crawling, non l'accesso né la rimozione garantita dai risultati di ricerca. Usa l'autenticazione per i contenuti privati. Per una pagina pubblica che deve essere esclusa dalla ricerca, consenti il crawling e fornisci noindex. Questo strumento di verifica riassume i gruppi e la policy della radice jolly; non esegue test su ogni URL. Indicazioni sulla ricerca: https://developers.google.com/search/docs/crawling-indexing/robots/intro
Come usarlo
- Inserisci una pagina qualsiasi del sito che vuoi controllare.
- Scegli «Verifica robots.txt».
- Esamina i gruppi, il totale delle regole, le sitemap e il codice sorgente completo.
Privacy e limitazioni
L’URL del sito viene inviato al servizio di recupero con limiti di TOEA e non viene memorizzato. Un file robots.txt ha valore indicativo; questo report non dimostra che ogni crawler lo seguirà.
Strumenti correlati
Domande frequenti
Dove deve trovarsi robots.txt?
In /robots.txt sull’host che vuoi controllare, ad esempio https://example.com/robots.txt. Un file in /blog/ non controlla l’intero sito e un sottodominio deve avere il proprio file.
Disallow rimuove una pagina dai risultati di ricerca?
No. Robots.txt controlla il crawling, non l’indicizzazione o l’accesso. Un URL bloccato può comunque comparire nei risultati di ricerca. Per escludere una pagina pubblica, consenti il crawling e invia una direttiva noindex; proteggi i contenuti privati con l’autenticazione.
Quali errori dovrei controllare per primi?
Disallow: / blocca l’intero sito, mentre un valore Disallow vuoto non blocca nulla. Controlla i percorsi che distinguono tra maiuscole e minuscole, i confini dei gruppi e l’eventuale blocco di risorse essenziali. Un gruppo di crawler nominato non eredita le regole dal gruppo con carattere jolly.
Strumento gratuito · sul server di toea esecuzioni · senza account