Herramienta web / 02
Comprobador de robots.txt
Convierte el archivo robots.txt de un sitio en un informe rápido y fácil de leer sobre sus políticas para rastreadores.
Comprobador de robots.txt: Lee las reglas para rastreadores, los grupos de agentes, las declaraciones de sitemap y el código fuente sin procesar del archivo robots.txt de un sitio. TOEA obtiene el archivo desde la raíz del sitio y resume la política de comodín para la ruta raíz. Esto ayuda a detectar bloqueos generales y reglas mal ubicadas; no comprueba si todas las páginas pueden indexarse. Se procesa de forma segura bajo demanda.
- Categoría
- Herramientas web
- Se ejecuta
- En el servidor de TOEA
- Coste
- Gratis · sin registro
- Disponibilidad
- Lista para usar
Un ejemplo breve de robots.txt
Coloca el archivo en la raíz del host, como /robots.txt. User-agent selecciona un grupo de rastreadores, Disallow pide a ese grupo que no solicite las rutas coincidentes y Allow puede establecer una excepción. Este ejemplo bloquea un directorio privado excepto su carpeta pública de prensa y declara un sitemap.
User-agent: *
Disallow: /private/
Allow: /private/press/
Sitemap: https://example.com/sitemap.xmlGana la ruta coincidente más larga; Allow gana en caso de empate. Las rutas distinguen entre mayúsculas y minúsculas. Las reglas de los grupos que coinciden con el mismo agente se combinan; un rastreador con nombre no hereda las reglas del grupo comodín. Referencia del protocolo: https://www.rfc-editor.org/rfc/rfc9309.html
Errores habituales que debes comprobar
Disallow: / bloquea todas las rutas, mientras que un valor Disallow vacío no bloquea ninguna. Un archivo situado en /blog/robots.txt no controla la raíz del sitio, y las reglas de un host no cubren un subdominio. Evita bloquear recursos que un buscador necesita para renderizar una página.
Robots.txt controla el rastreo, no el acceso ni la eliminación garantizada de los resultados de búsqueda. Usa autenticación para el contenido privado. Para excluir de la búsqueda una página pública, permite el rastreo y sirve noindex. Este comprobador resume los grupos y la política de raíz del comodín; no prueba todas las URL. Guía de búsqueda: https://developers.google.com/search/docs/crawling-indexing/robots/intro
Cómo se usa
- Introduce cualquier página del sitio que quieras comprobar.
- Selecciona «Comprobar robots.txt».
- Revisa sus grupos, el total de reglas, los sitemaps y el código fuente completo.
Privacidad y límites
La URL del sitio se envía al servicio de obtención limitada de TOEA y no se almacena. Un archivo robots.txt es orientativo; este informe no demuestra que todos los rastreadores vayan a seguirlo.
Herramientas relacionadas
Preguntas frecuentes
¿Dónde debe ubicarse robots.txt?
En /robots.txt del host que quieras controlar, por ejemplo, https://example.com/robots.txt. Un archivo dentro de /blog/ no controla todo el sitio, y un subdominio necesita su propio archivo.
¿Disallow elimina una página de los resultados de búsqueda?
No. Robots.txt controla el rastreo, no la indexación ni el acceso. Una URL bloqueada todavía puede aparecer en los resultados de búsqueda. Para excluir una página pública, permite el rastreo y sirve una directiva noindex; protege el contenido privado con autenticación.
¿Qué errores debería comprobar primero?
Disallow: / bloquea todo el sitio, mientras que un valor Disallow vacío no bloquea nada. Comprueba las rutas, que distinguen entre mayúsculas y minúsculas, los límites entre grupos y si están bloqueados recursos esenciales. Un grupo de rastreador con nombre no hereda las reglas del grupo de comodín.
Herramienta gratuita · se ejecuta en el servidor de toea · sin cuenta