Outil web / 02
Vérificateur de robots.txt
Transformez le fichier robots.txt d’un site en un rapport lisible sur les règles d’exploration.
Vérificateur de robots.txt: Consulte les règles d’exploration, les groupes d’agents, les déclarations de sitemap et le code source brut du fichier robots.txt d’un site. TOEA récupère le fichier à la racine du site et résume la politique du groupe générique pour le chemin racine. Cela aide à repérer les blocages trop larges et les règles mal placées ; cet outil ne vérifie pas que chaque page peut être indexée. Traitement sécurisé à la demande.
- Catégorie
- Outils web
- Exécutions
- Sur le serveur de TOEA
- Coût
- Gratuit · sans inscription
- Disponibilité
- Prêt à l'emploi
Un court exemple de robots.txt
Placez le fichier à la racine de l'hôte, à l'adresse /robots.txt. User-agent sélectionne un groupe d'exploration, Disallow demande à ce groupe de ne pas récupérer les chemins correspondants et Allow peut créer une exception. Cet exemple bloque un répertoire privé, à l'exception de son dossier de presse public, et déclare un sitemap.
User-agent: *
Disallow: /private/
Allow: /private/press/
Sitemap: https://example.com/sitemap.xmlLe chemin correspondant le plus long l'emporte ; Allow l'emporte en cas d'égalité. Les chemins sont sensibles à la casse. Les règles des groupes correspondant au même agent sont combinées ; un robot nommé n'hérite pas des règles du groupe générique. Référence du protocole : https://www.rfc-editor.org/rfc/rfc9309.html
Erreurs courantes à vérifier
Disallow: / bloque tous les chemins, tandis qu'une valeur Disallow vide ne bloque rien. Un fichier placé sous /blog/robots.txt ne contrôle pas la racine du site, et les règles d'un hôte ne s'appliquent pas à un sous-domaine. Évitez de bloquer les ressources dont un moteur de recherche a besoin pour afficher une page.
Robots.txt contrôle l'exploration, et non l'accès ni le retrait garanti des résultats de recherche. Utilisez une authentification pour les contenus privés. Pour une page publique qui doit être exclue des recherches, autorisez l'exploration et servez noindex. Ce vérificateur récapitule les groupes et la règle générique à la racine ; il ne teste pas chaque URL. Recommandations pour la recherche : https://developers.google.com/search/docs/crawling-indexing/robots/intro
Comment l'utiliser
- Saisissez une page du site que vous souhaitez vérifier.
- Choisissez « Vérifier robots.txt ».
- Consultez ses groupes, le nombre de règles, les sitemaps et le code source complet.
Confidentialité et limitations
L’URL du site est envoyée au service de récupération encadré de TOEA et n’est pas conservée. Un fichier robots.txt a une valeur indicative ; ce rapport ne prouve pas que tous les robots d’exploration le respecteront.
Outils associés
Questions fréquentes
Où placer robots.txt ?
À l’adresse /robots.txt sur l’hôte que vous souhaitez contrôler, par exemple https://example.com/robots.txt. Un fichier placé sous /blog/ ne contrôle pas l’ensemble du site, et un sous-domaine doit avoir son propre fichier.
Disallow supprime-t-il une page des résultats de recherche ?
Non. Robots.txt contrôle l’exploration, pas l’indexation ni l’accès. Une URL bloquée peut tout de même apparaître dans les résultats de recherche. Pour exclure une page publique, autorisez son exploration et diffusez une directive noindex ; protégez les contenus privés avec une authentification.
Quelles erreurs dois-je vérifier en premier ?
Disallow: / bloque l’ensemble du site, tandis qu’une valeur Disallow vide ne bloque rien. Vérifiez la casse des chemins, les limites entre les groupes et si les ressources essentielles sont bloquées. Un groupe d’agents nommé n’hérite pas des règles du groupe générique.
Outil gratuit · sur le serveur de toea exécutions · aucun compte requis