📋 文章目录

Robots.txt 生成器

0
1

在线使用工具

Powered by Keywords Everywhere

🎁  需要更多查询次数?下方升级链接,点击即可解锁

2

解锁更多查询次数

3

解锁更多查询次数

工作原理

生成器会根据您的选择实时生成文件:一个适用于所有机器人的默认规则组(允许所有、阻止所有,或您自定义的允许/禁止路径)、您勾选的每个 AI 爬虫的明确阻止规则,以及站点地图行。您可以复制该文件,或下载robots.txt后直接上传到您的网站根目录。

诚实的限制: robots.txt 只是行为良好的爬虫程序会遵守的请求,而不是访问控制;阻止爬虫抓取页面并不会将其从索引中删除(要删除页面,请使用 noindex 元标签)。所有操作都在您的浏览器中进行。

robots.txt 文件的作用是什么?

它告诉爬虫可以抓取你网站的哪些部分。行为良好的机器人(例如 Google、Bing 以及此处列出的 AI 爬虫)会在抓取之前读取它并遵守规则。它位于 [此处应填写具体位置] yoursite.com/robots.txt

robots.txt 会阻止 Google 抓取网页吗?

不,这一点很重要:robots.txt 阻止的是网络爬虫抓取,而不是索引。即使页面被阻止,如果其他网站链接到该页面,它仍然可能出现在搜索结果中(但没有描述)。要阻止页面被索引,请允许网络爬虫并使用noindexrobots 元标签。切勿依赖 robots.txt 来保护私有内容,因为它是公开请求,而不是访问控制。

如何屏蔽像 GPTBot 和 ClaudeBot 这样的 AI 爬虫?

勾选您想要屏蔽的机器人(或主开关),生成器将为每个机器人生成一个User-agent屏蔽列表,包含Disallow: /以下机器人:GPTBot、ChatGPT-User、ClaudeBot、anthropic-ai、PerplexityBot、Google-Extended、CCBot、Bytespider 和 meta-externalagent。这些供应商声明他们遵守 robots.txt 文件;屏蔽 Google-Extended 会使其退出 Gemini 训练,但不会影响 Google 搜索。

Disallow 和 Allow 有什么区别?

Disallow阻止以该值开头的路径;Allow并排除例外情况(例如,禁止/admin/但允许/admin/public/)。空值Disallow:表示“允许一切”,这是正确的显式默认值。

为什么没有延迟爬取选项?

说实话,因为谷歌对此置之不理,所以它从未被标准化,而且滥用弊大于利。建议在每个搜索引擎的站长工具中设置抓取频率。

我应该把文件放在哪里?

下载并上传到您的网站根目录,以便通过该目录访问https://yoursite.com/robots.txt。子目录不起作用;每个子域名都需要自己的 robots.txt 文件。然后使用我们的 robots.txt 测试工具进行测试。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注