Web-Werkzeug / 02

Robots.txt-Prüfer

Verwandle die robots.txt-Datei einer Website in einen schnellen, übersichtlichen Bericht zu ihren Crawler-Richtlinien.

Robots.txt-Prüfer: Lies die Crawler-Regeln, User-agent-Gruppen, Sitemap-Angaben und den Originalquelltext einer Website aus der robots.txt. TOEA ruft die Datei aus dem Stammverzeichnis der Website ab und fasst die Platzhalter-Richtlinie für den Root-Pfad zusammen. So lassen sich weitreichende Sperren und falsch platzierte Regeln erkennen; es wird jedoch nicht geprüft, ob jede Seite indexiert werden kann. Bei Bedarf sicher verarbeitet.

Ausführungen
Auf dem Server von TOEA
Kosten
Kostenlos · ohne Anmeldung
Verfügbarkeit
Einsatzbereit
robots.txt-AnsichtSichere Prüfung öffentlicher URLs

TOEA prüft die robots.txt im Stammverzeichnis der Website.

Ein kurzes robots.txt-Beispiel

Lege die Datei im Stammverzeichnis des Hosts unter /robots.txt ab. User-agent wählt eine Crawler-Gruppe aus, Disallow weist diese Gruppe an, passende Pfade nicht abzurufen, und Allow kann eine Ausnahme festlegen. Dieses Beispiel sperrt ein privates Verzeichnis mit Ausnahme seines öffentlichen Presseordners und gibt eine Sitemap an.

User-agent: *
Disallow: /private/
Allow: /private/press/

Sitemap: https://example.com/sitemap.xml

Der längste übereinstimmende Pfad hat Vorrang; bei Gleichstand gewinnt Allow. Bei Pfaden wird zwischen Groß- und Kleinschreibung unterschieden. Regeln aus Gruppen, die zum selben Agenten passen, werden zusammengeführt; ein namentlich genannter Crawler übernimmt nicht die Regeln der Platzhaltergruppe. Protokollreferenz: https://www.rfc-editor.org/rfc/rfc9309.html

Häufige Fehler prüfen

Disallow: / sperrt jeden Pfad, während ein leerer Disallow-Wert nichts sperrt. Eine Datei unter /blog/robots.txt steuert nicht das Stammverzeichnis der Website, und Regeln für einen Host gelten nicht für eine Subdomain. Vermeide es, Ressourcen zu sperren, die eine Suchmaschine zum Darstellen einer Seite benötigt.

Robots.txt steuert das Crawling, nicht den Zugriff und auch nicht die garantierte Entfernung aus den Suchergebnissen. Verwende für private Inhalte eine Authentifizierung. Wenn eine öffentliche Seite aus der Suche ausgeschlossen werden soll, erlaube das Crawling und liefere noindex aus. Dieser Prüfer fasst Gruppen und die Richtlinie für den Stamm mit Platzhalter zusammen; er testet nicht jede URL. Hinweise zur Suche: https://developers.google.com/search/docs/crawling-indexing/robots/intro

So benutzt du es

  1. Gib eine beliebige Seite der Website ein, die du prüfen möchtest.
  2. Wähle „robots.txt prüfen“.
  3. Sieh dir Gruppen, Regelanzahl, Sitemaps und den vollständigen Quelltext an.

Datenschutz & Einschränkungen

Die URL der Website wird an den begrenzten Abrufdienst von TOEA gesendet und nicht gespeichert. Eine robots.txt hat lediglich empfehlenden Charakter; dieser Bericht beweist nicht, dass jeder Crawler ihre Regeln befolgt.

Ähnliche Tools

Häufige Fragen

Wo sollte die robots.txt liegen?

Unter /robots.txt auf dem Host, den du steuern möchtest, zum Beispiel https://example.com/robots.txt. Eine Datei unter /blog/ steuert nicht die gesamte Website, und eine Subdomain benötigt eine eigene Datei.

Entfernt Disallow eine Seite aus den Suchergebnissen?

Nein. Die robots.txt steuert das Crawling, nicht die Indexierung oder den Zugriff. Eine gesperrte URL kann weiterhin in den Suchergebnissen erscheinen. Um eine öffentliche Seite auszuschließen, erlaube das Crawling und sende eine noindex-Anweisung; schütze private Inhalte mit einer Authentifizierung.

Welche Fehler sollte ich zuerst prüfen?

Disallow: / sperrt die gesamte Website, während ein leerer Disallow-Wert nichts sperrt. Prüfe die Groß- und Kleinschreibung von Pfaden, die Grenzen von Gruppen und ob wichtige Ressourcen gesperrt sind. Eine benannte Crawler-Gruppe übernimmt keine Regeln aus der Platzhaltergruppe.

Kostenloses Tool · läuft auf dem server von toea · kein Konto nötig