Herramienta web / 02

Comprobador de robots.txt

Convierte el archivo robots.txt de un sitio en un informe rápido y fácil de leer sobre sus políticas para rastreadores.

Comprobador de robots.txt: Lee las reglas para rastreadores, los grupos de agentes, las declaraciones de sitemap y el código fuente sin procesar del archivo robots.txt de un sitio. TOEA obtiene el archivo desde la raíz del sitio y resume la política de comodín para la ruta raíz. Esto ayuda a detectar bloqueos generales y reglas mal ubicadas; no comprueba si todas las páginas pueden indexarse. Se procesa de forma segura bajo demanda.

Se ejecuta
En el servidor de TOEA
Coste
Gratis · sin registro
Disponibilidad
Lista para usar
Lector de robots.txtComprobación segura de URL pública

TOEA comprueba el archivo robots.txt en la raíz del sitio.

Un ejemplo breve de robots.txt

Coloca el archivo en la raíz del host, como /robots.txt. User-agent selecciona un grupo de rastreadores, Disallow pide a ese grupo que no solicite las rutas coincidentes y Allow puede establecer una excepción. Este ejemplo bloquea un directorio privado excepto su carpeta pública de prensa y declara un sitemap.

User-agent: *
Disallow: /private/
Allow: /private/press/

Sitemap: https://example.com/sitemap.xml

Gana la ruta coincidente más larga; Allow gana en caso de empate. Las rutas distinguen entre mayúsculas y minúsculas. Las reglas de los grupos que coinciden con el mismo agente se combinan; un rastreador con nombre no hereda las reglas del grupo comodín. Referencia del protocolo: https://www.rfc-editor.org/rfc/rfc9309.html

Errores habituales que debes comprobar

Disallow: / bloquea todas las rutas, mientras que un valor Disallow vacío no bloquea ninguna. Un archivo situado en /blog/robots.txt no controla la raíz del sitio, y las reglas de un host no cubren un subdominio. Evita bloquear recursos que un buscador necesita para renderizar una página.

Robots.txt controla el rastreo, no el acceso ni la eliminación garantizada de los resultados de búsqueda. Usa autenticación para el contenido privado. Para excluir de la búsqueda una página pública, permite el rastreo y sirve noindex. Este comprobador resume los grupos y la política de raíz del comodín; no prueba todas las URL. Guía de búsqueda: https://developers.google.com/search/docs/crawling-indexing/robots/intro

Cómo se usa

  1. Introduce cualquier página del sitio que quieras comprobar.
  2. Selecciona «Comprobar robots.txt».
  3. Revisa sus grupos, el total de reglas, los sitemaps y el código fuente completo.

Privacidad y límites

La URL del sitio se envía al servicio de obtención limitada de TOEA y no se almacena. Un archivo robots.txt es orientativo; este informe no demuestra que todos los rastreadores vayan a seguirlo.

Herramientas relacionadas

Preguntas frecuentes

¿Dónde debe ubicarse robots.txt?

En /robots.txt del host que quieras controlar, por ejemplo, https://example.com/robots.txt. Un archivo dentro de /blog/ no controla todo el sitio, y un subdominio necesita su propio archivo.

¿Disallow elimina una página de los resultados de búsqueda?

No. Robots.txt controla el rastreo, no la indexación ni el acceso. Una URL bloqueada todavía puede aparecer en los resultados de búsqueda. Para excluir una página pública, permite el rastreo y sirve una directiva noindex; protege el contenido privado con autenticación.

¿Qué errores debería comprobar primero?

Disallow: / bloquea todo el sitio, mientras que un valor Disallow vacío no bloquea nada. Comprueba las rutas, que distinguen entre mayúsculas y minúsculas, los límites entre grupos y si están bloqueados recursos esenciales. Un grupo de rastreador con nombre no hereda las reglas del grupo de comodín.

Herramienta gratuita · se ejecuta en el servidor de toea · sin cuenta