SEO / 抓取

robots.txt生成器

创建robots.txt文件,为每个爬虫设置规则,添加sitemap行,并使用允许所有爬虫、屏蔽暂存网站或屏蔽AI训练爬虫等预设。

robots.txt生成器: robots.txt会告诉爬虫可以抓取哪些路径。根据RFC 9309的标准,每个组会先列出用户代理,然后列出Disallow和Allow规则;如果多条规则匹配,则以最具体的规则为准。AI训练预设会为GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、CCBot和meta-externalagent添加一个组。这些名称是其运营方文档中列出的、用于选择不参与训练的爬虫名称。生成器会提醒您注意没有前导斜杠的路径、相对sitemap网址,以及会屏蔽所有爬虫的规则。 完全在浏览器中本地运行,文件不会上传到服务器。

使用次数
在浏览器中
费用
免费·无需注册
可用性
可直接使用
robots.txt生成器本地处理

完全在浏览器中运行

组1
User-agent: *
Disallow: /admin/
Disallow: /cart/

Sitemap: https://example.com/sitemap.xml

请将文件放在网站根目录,例如https://example.com/robots.txt。它只是要求爬虫不要访问,并不能隐藏或保护任何内容,而且Google会忽略Crawl-delay。AI爬虫名称已于2 October 2026核对;公司会添加新的爬虫,因此请查看其文档。

常见错误

屏蔽CSS和JavaScript会阻止搜索引擎正确呈现网页;屏蔽想要移除的页面会使爬虫看不到其noindex标记;网站上线后仍保留暂存站点的Disallow: /会隐藏整个网站。每次部署后都要检查线上文件。

要测试现有文件,请使用robots.txt检查工具;要检查该文件指向的sitemap,请使用sitemap检查工具。

通配符

Google和Bing支持表示任意字符的*以及表示网址末尾的$:Disallow: /*.pdf$会屏蔽所有PDF。匹配结果最长的规则优先,因此Allow: /shop/sale/会覆盖Disallow: /shop/。

使用方法

  1. 从预设开始,或编辑用户代理和路径组。
  2. 添加sitemap网址。
  3. 复制或下载robots.txt,并将其放在网站根目录中。

隐私与限制

文件会在您的浏览器中生成。

相关工具

常见问题

robots.txt会阻止网页出现在Google搜索中吗?

它会阻止抓取,而不是阻止编入索引:如果其他网站链接到被阻止的网页,该网页仍可能出现在搜索结果中。要让网页不出现在搜索结果中,请允许抓取,并添加noindex元标记。

屏蔽AI爬虫会让我的内容从AI工具中消失吗?

这会要求这些爬虫从现在起不要收集您的网页;但不会移除已经收集的内容,而且只有遵守robots.txt的爬虫才会执行这一要求。

Crawl-delay有效吗?

Bing和其他一些爬虫会遵守它;Google会忽略它,并自动调整抓取速率。

免费工具·使用在浏览器中次·无需账户