📋 文章目录

Robots.txt 测试器

0
1

在线使用工具

Powered by Keywords Everywhere

🎁  需要更多查询次数?下方升级链接,点击即可解锁

2

解锁更多查询次数

3

解锁更多查询次数

工作原理

测试工具会一次性获取网站的实时 robots.txt 文件,之后的所有操作都在您的浏览器中进行:该文件会根据 robots.txt 标准 (RFC 9309) 进行解析,您输入的每个 URL 都会按照爬虫程序的方式进行匹配,匹配规则为:用户代理组最具体、规则最长优先、规则长度相同时允许访问、支持*通配符$。每次匹配结果都会显示对应的规则及其行号。

爬虫列表包含了当前的 AI 训练和浏览机器人,因此“我们是否真的屏蔽了 GPTBot?”只需十秒钟即可完成检查。您也可以粘贴草稿文件并在本地进行测试,然后再部署。

如何测试 robots.txt 文件?

输入域名并点击“获取 robots.txt ”。此时会显示该文件,然后您可以选择要测试的爬虫(Googlebot、GPTBot、ClaudeBot 等,或自定义令牌),粘贴您关心的 URL,每个 URL 都会返回“允许”“阻止”的结果,并显示做出此决定的具体规则和行号。

规则是如何解读的?

robots.txt 标准 (RFC 9309) 和 Google 的解释方式如下:爬虫使用最具体的匹配用户代理组,最长的匹配规则路径优先,如果Allow路径Disallow相同则优先,*匹配路径内的任何内容并$锚定路径末尾,如果缺少文件则表示允许所有内容。

我可以查看一下人工智能爬虫是否被屏蔽了吗?

是的,这项功能已内置:您可以测试 GPTBot、ChatGPT-User、ClaudeBot、anthropic-ai、PerplexityBot、Google-Extended、CCBot、Bytespider 或 meta-externalagent,看看它们各自会抓取哪些内容。要生成屏蔽规则,请使用我们的 Robots.txt 生成器。

该网站没有 robots.txt 文件。这意味着什么?

一切皆可抓取:爬虫会将 robots.txt 上的 404 错误视为“无限制”。测试人员会如实报告此情况,而不是报错。请注意,某些网站会在 /robots.txt 返回一个 HTML 页面(单页应用回退方案);爬虫会忽略该页面,我们也会忽略,并为您标记出来。

“已屏蔽”是否意味着该页面已从谷歌搜索结果中移除?

不,被屏蔽意味着谷歌不会抓取该页面;该网址仍然可以通过链接被索引(显示时没有描述)。要从搜索结果中移除某个页面,请允许抓取并使用 noindex 元标签。这是 robots.txt 文件中最常见的错误。

我可以测试一个尚未部署的 robots.txt 文件吗?

是的,点击“粘贴 robots.txt 文件”并将您的 robots.txt 文件草稿拖放到其中;解析和测试将完全在您的浏览器中运行,无需任何 fetch 请求。非常适合在上传文件之前,使用我们的 robots.txt 生成器验证文件。

是否存在极限?

获取实时 robots.txt 文件会消耗您每日页面抓取配额的 1 个单位(配额横幅会显示);粘贴的文件则没有限制,因为不会对服务器造成任何影响。一次最多可测试 100 个 URL。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注