网页工具 / 02

Robots.txt检查工具

将网站的robots.txt文件转换为简洁易读的爬虫策略报告。

Robots.txt检查工具: 读取网站的robots.txt爬虫规则、代理组、站点地图声明和原始源内容。TOEA会从网站根目录获取该文件,并汇总其对根路径的通配符策略。这有助于发现范围过大的屏蔽规则和放置错误的规则;但它不会测试每个页面是否都能被编入索引。 按需安全处理。

使用次数
在TOEA服务器上
费用
免费·无需注册
可用性
可直接使用
robots.txt读取器安全公开网址检查

TOEA会检查网站根目录中的robots.txt文件。

一个简短的robots.txt示例

将文件放在主机根目录下,即/robots.txt。User-agent用于选择爬虫组,Disallow要求该组不要抓取匹配的路径,Allow可以设置例外。此示例会屏蔽一个私有目录,但允许访问其中的公开媒体文件夹,并声明一个sitemap。

User-agent: *
Disallow: /private/
Allow: /private/press/

Sitemap: https://example.com/sitemap.xml

匹配的路径中,最长路径优先;如果长度相同,则Allow优先。路径区分大小写。匹配同一代理的组,其规则会合并;指定名称的爬虫不会继承通配符组的规则。协议参考:https://www.rfc-editor.org/rfc/rfc9309.html

检查常见错误

Disallow: /会屏蔽所有路径,而空的Disallow值不会屏蔽任何内容。位于/blog/robots.txt的文件不会控制网站根目录,某个主机上的规则也不会覆盖子域名。请避免屏蔽搜索引擎渲染页面所需的资源。

Robots.txt控制抓取,不控制访问权限,也不能保证从搜索结果中移除。私有内容请使用身份验证。对于必须排除在搜索结果之外的公开页面,应允许抓取并提供noindex。此检查工具会总结各组和通配符根目录策略,但不会测试每个网址。搜索指南:https://developers.google.com/search/docs/crawling-indexing/robots/intro

使用方法

  1. 输入要检查的网站中的任意页面。
  2. 选择“检查robots.txt”。
  3. 查看其中的组、规则总数、站点地图和完整源内容。

隐私与限制

网站网址会发送到TOEA的受限抓取服务,但不会被存储。robots.txt仅供参考;此报告无法证明每个爬虫都会遵守其中的规则。

相关工具

常见问题

robots.txt应该放在哪里?

应放在要控制的网站主机的/robots.txt位置,例如https://example.com/robots.txt。放在/blog/下的文件无法控制整个网站,子域名也需要单独的文件。

Disallow会将页面从搜索结果中移除吗?

不会。Robots.txt控制的是抓取,而不是编入索引或访问权限。被屏蔽的网址仍可能出现在搜索结果中。若要排除公开页面,应允许抓取并提供noindex指令;私密内容则应使用身份验证进行保护。

首先应该检查哪些错误?

Disallow: /会屏蔽整个网站,而空的Disallow值不会屏蔽任何内容。请检查路径是否区分大小写、组的边界是否正确,以及是否屏蔽了必要的资源。指定名称的爬虫组不会继承通配符组中的规则。

免费工具·使用在toea服务器上次·无需账户