SEO / 抓取
robots.txt生成器
创建robots.txt文件,为每个爬虫设置规则,添加sitemap行,并使用允许所有爬虫、屏蔽暂存网站或屏蔽AI训练爬虫等预设。
robots.txt生成器: robots.txt会告诉爬虫可以抓取哪些路径。根据RFC 9309的标准,每个组会先列出用户代理,然后列出Disallow和Allow规则;如果多条规则匹配,则以最具体的规则为准。AI训练预设会为GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、CCBot和meta-externalagent添加一个组。这些名称是其运营方文档中列出的、用于选择不参与训练的爬虫名称。生成器会提醒您注意没有前导斜杠的路径、相对sitemap网址,以及会屏蔽所有爬虫的规则。 完全在浏览器中本地运行,文件不会上传到服务器。
- 类别
- 网络工具
- 使用次数
- 在浏览器中
- 费用
- 免费·无需注册
- 可用性
- 可直接使用
完全在浏览器中运行
User-agent: * Disallow: /admin/ Disallow: /cart/ Sitemap: https://example.com/sitemap.xml
请将文件放在网站根目录,例如https://example.com/robots.txt。它只是要求爬虫不要访问,并不能隐藏或保护任何内容,而且Google会忽略Crawl-delay。AI爬虫名称已于2 October 2026核对;公司会添加新的爬虫,因此请查看其文档。
常见错误
屏蔽CSS和JavaScript会阻止搜索引擎正确呈现网页;屏蔽想要移除的页面会使爬虫看不到其noindex标记;网站上线后仍保留暂存站点的Disallow: /会隐藏整个网站。每次部署后都要检查线上文件。
要测试现有文件,请使用robots.txt检查工具;要检查该文件指向的sitemap,请使用sitemap检查工具。
通配符
Google和Bing支持表示任意字符的*以及表示网址末尾的$:Disallow: /*.pdf$会屏蔽所有PDF。匹配结果最长的规则优先,因此Allow: /shop/sale/会覆盖Disallow: /shop/。
使用方法
- 从预设开始,或编辑用户代理和路径组。
- 添加sitemap网址。
- 复制或下载robots.txt,并将其放在网站根目录中。
隐私与限制
文件会在您的浏览器中生成。
相关工具
常见问题
robots.txt会阻止网页出现在Google搜索中吗?
它会阻止抓取,而不是阻止编入索引:如果其他网站链接到被阻止的网页,该网页仍可能出现在搜索结果中。要让网页不出现在搜索结果中,请允许抓取,并添加noindex元标记。
屏蔽AI爬虫会让我的内容从AI工具中消失吗?
这会要求这些爬虫从现在起不要收集您的网页;但不会移除已经收集的内容,而且只有遵守robots.txt的爬虫才会执行这一要求。
Crawl-delay有效吗?
Bing和其他一些爬虫会遵守它;Google会忽略它,并自动调整抓取速率。
免费工具·使用在浏览器中次·无需账户